تستخدم النماذج الحديثة مثل Claude Opus كعوامل متقدمة لتوليد مهام الوكلاء والتحقق منها أثناء التدريب. ولكن، توافر صورة Docker قابلة للتشغيل ومجموعة اختبارات تنفيذية لا يضمن وجود خط أنابيب دقيق للتدريب. في دراسة حديثة، تم تقديم إطار عمل جديد للوكيل الصادر كحل لهذه الفجوة، حيث تم تشخيص ثلاث فئات من الفشل: عدم صحة المعايير، هشاشة البنية، وسوء تنسيق المكافآت.
أشارت النتائج إلى أن إعادة تصميم المحفزات وتوسيع السياق أديا إلى زيادة في قابلية الحل بمقدار 5.6 مرة. ورغم ذلك، فإن نموذج بقدرة 9 مليارات يتم إشباعه عند 81.3% في اختبار متوسط خلال 20 خطوة على المهام التي تم إنشاؤها بواسطة Claude Opus. كذلك، أظهرت التجارب أن إضافة مهام صعبة أدت إلى تقليل متوسط النجاح إلى 20.6% دون تغيير في إعدادات التدريب، مما يؤكد أن نطاق القابلية للحل خاص بالنموذج.
هذه النتائج توضح أن موثوقية وكيل النموذج تتطلب معايرة نطاق القابلية للحل، وتدقيق المثبتات، وإجراء حساب الأخطاء في البنية التحتية كمعايير تقييم أساسية، بدلاً من الاعتماد على تشخيصات ما بعد الحدث. ما رأيكم في هذه التطورات المهمة التي ستُشكل مستقبل الذكاء الاصطناعي؟ شاركونا في التعليقات!
تحديات تدريب الوكلاء: كيفية تجاوز عقبات توليد البيانات والتحقق منها!
تزايد الاعتماد على النماذج المتقدمة مثل Claude Opus لتوليد المهام الوكيلة يكشف عن فجوات كبيرة في عملية التدريب. دراسة جديدة تسلط الضوء على تصنيف الفشل وتعزيز الحلول الفعالة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
