في دراسة مثيرة نشرت على موقع arXiv، يستعرض الباحثون سلوك نماذج اللغة الضخمة (Large Language Models) عند مواجهة ظروف نادرة من الفشل. يتنوع معدل الفشل من 0.2 إلى 0.0001، مما يتيح للباحثين قياس تفاعل النماذج ودرجة انخراطها في تقديم التفسيرات. وفي حين توقعوا زيادة في تفاعل النماذج مع ندرة الفشل، كان هناك بعض النتائج غير المتوقعة.

تم بناء نظام محلي منخفض التكلفة للتجارب على ثلاثة نماذج مفتوحة الوزن (qwen3:8b، llama3.1:8b، mistral:7b) حيث تم إجراء مهام تكرارية مع ضبط معدل الفشل. في البداية، تضاربت النتائج مع التوقعات، حيث أظهرت النماذج انخفاضًا في طول التفسيرات بشكل متواصل.

ومع ذلك، تطلعت النتائج تحت ظروف معينة مثل "الإجبار الفوري"، حيث يُطلب من النموذج تقديم تفسير لكل فشل بشكل فوري، إلى زيادة في الطول نحو 28.4 كلمة عند معدل فشل 0.05، تليها استقرار عند 17.4-19.0 كلمة عند أدنى المعدلات. كما لاحظ الباحثون زيادة غير متكافئة في مستوى الثقة من حوالي 53% إلى 70-90% مع تكرار التجارب.

تظهر الدراسة أن هيكل elicitation يُعتبر وسيطًا رئيسًا في رصد الانهيار الملاحظ. وتجربة إضافية مع معدلات فشل مضمونة تُظهر اختلافًا في كيفية تعرف النماذج على الانحرافات في الأداء.

يُلفت الباحثون الانتباه إلى أن النقاط المعزولة لمعدل الفشل لا تستطيع التقاط السلوك بين تلك النقاط، مما يشير إلى وجوب تكثيف الدراسات المستقبلية لتعميق فهمنا في هذا المجال.