تستخدم النماذج الحديثة مثل Claude Opus كعوامل متقدمة لتوليد مهام الوكلاء والتحقق منها أثناء التدريب. ولكن، توافر صورة Docker قابلة للتشغيل ومجموعة اختبارات تنفيذية لا يضمن وجود خط أنابيب دقيق للتدريب. في دراسة حديثة، تم تقديم إطار عمل جديد للوكيل الصادر كحل لهذه الفجوة، حيث تم تشخيص ثلاث فئات من الفشل: عدم صحة المعايير، هشاشة البنية، وسوء تنسيق المكافآت.

أشارت النتائج إلى أن إعادة تصميم المحفزات وتوسيع السياق أديا إلى زيادة في قابلية الحل بمقدار 5.6 مرة. ورغم ذلك، فإن نموذج بقدرة 9 مليارات يتم إشباعه عند 81.3% في اختبار متوسط خلال 20 خطوة على المهام التي تم إنشاؤها بواسطة Claude Opus. كذلك، أظهرت التجارب أن إضافة مهام صعبة أدت إلى تقليل متوسط النجاح إلى 20.6% دون تغيير في إعدادات التدريب، مما يؤكد أن نطاق القابلية للحل خاص بالنموذج.

هذه النتائج توضح أن موثوقية وكيل النموذج تتطلب معايرة نطاق القابلية للحل، وتدقيق المثبتات، وإجراء حساب الأخطاء في البنية التحتية كمعايير تقييم أساسية، بدلاً من الاعتماد على تشخيصات ما بعد الحدث. ما رأيكم في هذه التطورات المهمة التي ستُشكل مستقبل الذكاء الاصطناعي؟ شاركونا في التعليقات!