في دراسة مثيرة، تم التحقيق في كيفية تعامل نماذج اللغات الضخمة (LLMs) مع الائتمان في سياق بيئة أدوات محددة (ALFWorld)، حيث تم فحص أداء الأنظمة الحالية مقارنةً بالحقائق السببية المُنفذة. تُظهر النتائج أن الأنظمة الحالية، بما في ذلك درجات LLM-judge ونسب الحظ المشروطة الناتجة، لا تستطيع التميز بشكل موثوق بين الخطوات المهمة وكأنها فرص عشوائية.

تحديات هذه الأنظمة تكمن في أنها تُقيم بناءً على صحة الخطوات المُعلمة، في حين أن هذه الدراسة تركز على المساهمة الفعلية لكل خطوة في القرار. ومن خلال إعادة تجميع البدائل في كل نقطة قرار، تم الكشف عن أن المساهمة الفعلية تكون نادرة، حيث تقتصر على 30.5% فقط من النقاط التي يمكن قياس الأثر فيها.

الأمر المثير للاهتمام هو أن قابلية القياس تعتمد على النموذج المستخدم، حيث تختلف نسبة النقاط التي ليس لها دعم من السياسات المعتمدة بمعدل الضعف بين نماذج مشابهة. يشير البحث إلى أن المشكلات المعروفة مرتبطة بتغطية الائتمان الضمني الذي يعكس ببساطة سلاسة السياسة، بينما لا تُضيف الشروط الناتجة أي معلومات سببية إضافية.

في تجربة تدريب مسجلة مسبقاً باستخدام سبعة أسلحة، لم يتمكن أي سلاح من التفوق بشكل موثوق على السياسة غير المدربة، مما يسلط الضوء على أن أثر التكوين التدريبي قد يفسر في الواقع الاختلافات الناتجة. بناءً على هذه النتائج، يتضح أنه يجب أن تتناسب المقارنات بشأن قواعد الائتمان مع حجم العينات الفعالة، لأنها تقيس الجرعة بدلاً من الائتمان الفعلي.