في عالم الذكاء الاصطناعي، تعتبر نماذج اللغة الكبيرة (LLM) واحدة من أبرز الإنجازات التكنولوجية. ولكن، هل يمكن الاعتماد على هذه النماذج لإبلاغ تقدم المهام أثناء التنفيذ؟ هذا السؤال كان محور دراسة مثيرة أجراها الباحثون باستخدام معايير تقييم عامة مثل $ au^2$-bench وStageIF.

تظهر النتائج أن قدرة النماذج على الإبلاغ عن تقدم المهام تعتمد على المرحلة التي وصلت إليها المهمة. وقد لوحظ أنه في أغلب الحالات، تتمتع النماذج بدقة عالية خلال بعض المراحل، بينما تنخفض دقتها في مراحل أخرى. هذه الديناميكية تعني أن النماذج غالباً ما تفقد الدقة عندما تبدأ المهام، ولكنها تستعيد تلك الدقة بمجرد انتهاء المهمة.

الأخبار المثيرة تأتي من الجيل الأحدث من هذه النماذج، حيث تتلاشى الانخفاضات أثناء سير المهام ولكنها تزداد حذراً عند الوصول إلى خط النهاية. هذه النتائج تشدد على ضرورة عدم اعتماد أطر العمل الخاصة بالوكالات بشكل كامل على التقارير التي تصدرها النماذج.

بذلك، توفر الدراسة بروتوكول تقييم يمتد عبر جميع مراحل تنفيذ المهام، مما يساعد على فهم الفجوات في القدرة على الإبلاغ عن تقدم المهام. هل تعتقد أننا يجب أن نتعامل بحذر أكبر عند استخدام مثل هذه النماذج في اتخاذ القرارات التشغيلية؟ شاركونا بآرائكم في التعليقات.