تعتبر موثوقية الأنظمة المعتمدة على نماذج اللغات الضخمة (LLMs) من الأمور الحيوية التي تؤثر على الأداء العام لتلك الأنظمة، حيث يتخطى مفهوم الموثوقية مجرد النتيجة النهائية للمهام. ولتوسيع فهمنا لهذا الموضوع، تم تقديم AGENTCHAOSBENCH، معيار جديد يهدف إلى اكتشاف وتحديد الأعطال التشغيلية في الأنظمة الذكية من بيانات التنفيذ.

تتنوع التطبيقات المستخدمة في التجربة، حيث تم تنفيذ خمسة تطبيقات مختلفة تنسق بين الوكلاء عبر بروتوكول الوكيل إلى الوكيل (Agent-to-Agent Protocol)، وتستخدم بروتوكول سياق النموذج (Model Context Protocol) لاستدعاء الأدوات. تم إدخال عشرة أنواع من الأعطال التشغيلية، مثل الأدوات غير المتاحة أو البطيئة، والاستجابات المنقوصة أو الكبيرة جدًا، بالإضافة إلى فشل التفويضات، مما انعكس على أداء الأنظمة.

المجموعة الناتجة تحتوي على 275 سجلًا، منها 250 تنفيذًا مع أعطال من عشرة أنواع و25 من دون أعطال، مما يوفر أساسًا قويًا لفهم كيفية حدوث المشاكل. ومع ذلك، فإن النتائج الأولية لأساليب الاعتماد على نموذج لغوي دون استعداد مسبق أظهرت أن التحدي لا يزال كبيرًا، حيث لم تتجاوز الدقة في تحديد نوعية الأعطال نسبة 20%.

هذه النتائج تشير إلى أن استخدام الإشارات المرجعية يعزز من جودة النتائج المحددة، ولكنه لا يحل بالكامل مشكلة تجاوز الحواجز. إن بيانات التنفيذ المحفوظة والأشكال التنبؤية المدمجة تدعم القدرة على مقارنة الأساليب القابلة للتكرار سواء كان ذلك مع الأنماط المعتمدة على نماذج لغات ضخمة أو بدونها.