في دراسة مثيرة، تم التحقيق في كيفية تعامل نماذج اللغات الضخمة (LLMs) مع الائتمان في سياق بيئة أدوات محددة (ALFWorld)، حيث تم فحص أداء الأنظمة الحالية مقارنةً بالحقائق السببية المُنفذة. تُظهر النتائج أن الأنظمة الحالية، بما في ذلك درجات LLM-judge ونسب الحظ المشروطة الناتجة، لا تستطيع التميز بشكل موثوق بين الخطوات المهمة وكأنها فرص عشوائية.
تحديات هذه الأنظمة تكمن في أنها تُقيم بناءً على صحة الخطوات المُعلمة، في حين أن هذه الدراسة تركز على المساهمة الفعلية لكل خطوة في القرار. ومن خلال إعادة تجميع البدائل في كل نقطة قرار، تم الكشف عن أن المساهمة الفعلية تكون نادرة، حيث تقتصر على 30.5% فقط من النقاط التي يمكن قياس الأثر فيها.
الأمر المثير للاهتمام هو أن قابلية القياس تعتمد على النموذج المستخدم، حيث تختلف نسبة النقاط التي ليس لها دعم من السياسات المعتمدة بمعدل الضعف بين نماذج مشابهة. يشير البحث إلى أن المشكلات المعروفة مرتبطة بتغطية الائتمان الضمني الذي يعكس ببساطة سلاسة السياسة، بينما لا تُضيف الشروط الناتجة أي معلومات سببية إضافية.
في تجربة تدريب مسجلة مسبقاً باستخدام سبعة أسلحة، لم يتمكن أي سلاح من التفوق بشكل موثوق على السياسة غير المدربة، مما يسلط الضوء على أن أثر التكوين التدريبي قد يفسر في الواقع الاختلافات الناتجة. بناءً على هذه النتائج، يتضح أنه يجب أن تتناسب المقارنات بشأن قواعد الائتمان مع حجم العينات الفعالة، لأنها تقيس الجرعة بدلاً من الائتمان الفعلي.
تحقيقات التقييم خطوة بخطوة: كيف تتعامل نماذج اللغات الضخمة (LLM) مع الائتمان بدون حقائق واضحة؟
تحدثت دراسة جديدة عن عدم قدرة نماذج اللغات الضخمة (LLMs) على تحديد الخطوات المهمة بشكل موثوق عند تقييم الأداء، مما يسلط الضوء على ضعف الأساليب الحالية. البحث يظهر أن المعلومات المطلوبة للحكم على الأداء قد تكون أكثر تعقيداً مما يبدو.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
