تشهد نماذج اللغات الضخمة (LLM) اهتماماً متزايداً بوصفها أنظمة متعددة الاستخدامات، يُنتظر منها التعامل مع الطلبات الحقيقية للمستخدمين. لكن السلوك الديناميكي للتصعيد في البيئات الواقعية لا يزال غير مفهوم جيداً. في هذا البحث، نقوم بالتحقيق المنهجي في محورين رئيسيين لفهم كيفية تصعيد حركة اللغات الكبيرة في وقت الاختبار.

نبدأ بتقديم معيار واقعي يوفر إطاراً موحداً لتقييم وكلاء النماذج اللغوية الكبيرة عبر مجالات البحث، البرمجة، التفكير، واستخدام الأدوات، مما يعكس بشكل أكثر دقة تنوع النشر في الواقع.

أثبت تقييم عشرة من أبرز وكلاء النماذج اللغوية الكبيرة تدهوراً كبيراً في الأداء عند الانتقال من التقييمات المحددة للنطاق إلى هذا الوضع الواقعي. بناءً على هذه الأسس، قمنا بتوسيع قدرات الاختبار تدريجياً على طول رؤوس دقيقة لنحدد الحد الأقصى للأداء. اكتشفنا أن أي من محورين التصعيد لا يمكنه تقديم مكاسب معنوية من الحوسبة الإضافية في البيئات الواقعية. ونسبنا هذا الظاهرة إلى قيود أساسية: "السابقة القابلة للاختناق" التي تعيق التصعيد المتسلسل، و"فجوة التحقق" التي تقوض التصعيد المتوازي.

الشفرة المتاحة للجمهور على https://github.com/cxcscmu/General-AgentBench تعرض تفاصيل إضافية حول هذا البحث وتوفر فرصة للمزيد من الاستكشاف في هذا المجال الديناميكي.