تشهد نماذج اللغات الضخمة (LLM) اهتماماً متزايداً بوصفها أنظمة متعددة الاستخدامات، يُنتظر منها التعامل مع الطلبات الحقيقية للمستخدمين. لكن السلوك الديناميكي للتصعيد في البيئات الواقعية لا يزال غير مفهوم جيداً. في هذا البحث، نقوم بالتحقيق المنهجي في محورين رئيسيين لفهم كيفية تصعيد حركة اللغات الكبيرة في وقت الاختبار.
نبدأ بتقديم معيار واقعي يوفر إطاراً موحداً لتقييم وكلاء النماذج اللغوية الكبيرة عبر مجالات البحث، البرمجة، التفكير، واستخدام الأدوات، مما يعكس بشكل أكثر دقة تنوع النشر في الواقع.
أثبت تقييم عشرة من أبرز وكلاء النماذج اللغوية الكبيرة تدهوراً كبيراً في الأداء عند الانتقال من التقييمات المحددة للنطاق إلى هذا الوضع الواقعي. بناءً على هذه الأسس، قمنا بتوسيع قدرات الاختبار تدريجياً على طول رؤوس دقيقة لنحدد الحد الأقصى للأداء. اكتشفنا أن أي من محورين التصعيد لا يمكنه تقديم مكاسب معنوية من الحوسبة الإضافية في البيئات الواقعية. ونسبنا هذا الظاهرة إلى قيود أساسية: "السابقة القابلة للاختناق" التي تعيق التصعيد المتسلسل، و"فجوة التحقق" التي تقوض التصعيد المتوازي.
الشفرة المتاحة للجمهور على https://github.com/cxcscmu/General-AgentBench تعرض تفاصيل إضافية حول هذا البحث وتوفر فرصة للمزيد من الاستكشاف في هذا المجال الديناميكي.
استكشاف تصعيد وقت الاختبار لوكلاء النماذج اللغوية الكبيرة: فهم سلوكهم في بيئات واقعية
يستعرض البحث سلوك وكلاء النماذج اللغوية الكبيرة (LLM) في البيئات الواقعية، مسلطاً الضوء على قيود التصعيد العملي أثناء التفاعل. النتائج تكشف عن تدهور كبير في الأداء عند الانتقال إلى إعدادات أكثر تعقيداً.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
