في عالم الذكاء الاصطناعي المتزايد، تلعب النماذج اللغوية الكبرى (LLMs) دورًا محوريًا كعملاء في اتخاذ القرارات، وذلك في بيئات تتطلب استكشافًا متقدمًا. مع ذلك، تظهر تساؤلات حول كيفية موازنة هذه النماذج بين الاستكشاف والاستغلال.

تقديم مفهوم "اللصوص الدلالية"، الذي يمثل امتدادًا لإعدادات اللصوص متعدد الأذرع، يوفر إطارًا لدراسة تأثير العلامات النصية المخصصة على سلوك الاستكشاف لدى النماذج.

أظهرت الدراسة أن العلامات النصية المفيدة دلاليًا تؤدي إلى تقليل الاستكشاف لصالح الاستغلال، مما يزيد الأداء عندما تتماشى مع هيكل المكافآت، بينما تسبب انخفاضًا حادًا في الأداء عند عدم توافقها.

علاوة على ذلك، كشف البحث أن المكافآت السلبية تحفز استكشافًا أكبر بكثير مقارنةً بالمكافآت الإيجابية المماثلة، وهذا يتماشى مع تحيز معروف بسبب المعايير المستخدم في البيانات السابقة التدريب.

استنادًا إلى النتائج، نستنتج أن استخدام اللغة في تعريف البيئة والمكافآت يؤدي إلى تحيزات لا يمكن تجنبها، مما يسلط الضوء على ضرورة تحسين موثوقية وفعالية العملاء الذكيين في اتخاذ قرارات في العالم الواقعي.