في دراسة جديدة على نماذج اللغة الكبيرة (LLMs)، تم تسليط الضوء على تحديات الثبات في الأداء أثناء التفاعلات الممتدة. رغم إمكانية أداء هذه الوكالات بشكل جيد في مهام معزولة، إلا أن الأمور تتغير عند استمرارية التفاعل. يهدف البحث إلى تقييم الثبات الزمني لهذه الوكالات من خلال تجربة مدروسة تضم 20 خطوة متعددة الوكلاء، مستلهمة من دراسات الرضا المتأخر. في كل خطوة، يواجه الوكيل خيار التأجيل للحصول على مكافأة أو المطالبة بها على الفور، مما ينهي الحلقة التفاعلية.
اعتمد فريق البحث على تحليل شامل تضمن استراتيجيات متنوعة تأخذ بعين الاعتبار مدى الرؤية الاجتماعية (خاصة أو عامة)، ومؤثرات الضغط على الشخصية، وسياسات التأمل. خضع التحليل لـ 84,540 مسارًا عبر 8 عائلات نموذجية.
لتحليل اختلافات الفشل، قام الباحثون ببناء تصنيف يتضمن سبع فئات اشتقت من 13,780 أثر تفكير لوكلاء اختاروا إنهاء الحلقة. باستخدام نموذج مساعدة LLM للتمييز ومراجعة بشرية، أظهرت النتائج كيف تتغير ملفات الفشل مع تقدم الوقت والسياق: غالبًا ما تكون الأخطاء المبكرة مدفوعة بالاندفاع، بينما تميل الأخطاء اللاحقة إلى التأطير في سياق الإرهاق والفوائد التكلفة.
كما تم الكشف عن علاقة بين التفكير غير المتسق في الأداء: حيث أظهرت الدراسات أن فترة تفكير أطول ترتبط بمعدل أعلى من التناقض الداخلي في المبررات، ما يتعارض مع الافتراض الذين يروجون بأن النصوص الأكثر تفكيرًا تدل على ثبات أكبر.
بشكل عام، تقدم هذه التحليلات، من حيث النجاة والمبررات، رؤى هامة حول الأنماط الزمنية الخاصة بالنماذج وعلامات الفشل المميزة لكل نموذج، مما يوفر آلية لتشخيص عدم الثبات في سلوكيات الوكلاء ذو الأداء المتعدد الجولات.
استراتيجيات جديدة لتقييم ثبات وكالات النماذج اللغوية: تحليل مفصل لفرص النجاة والفشل
تقدم الدراسة الجديدة رؤى هامة حول استقرار وكالات النماذج اللغوية (LLM) في تفاعلات متعددة الجولات، مسلطة الضوء على الأنماط العقلية المرتبطة بفشل تلك النماذج. التحليل يكشف عن الروابط المعقدة بين الاصطفاف الاجتماعي والتفكير الفريد لكل نموذج.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
