تعتبر القدرة على استدعاء الأدوات الخارجية إحدى الركائز الأساسية في نماذج اللغات الكبيرة (Large Language Models) حيث تتيح لها الإنجاز في مهام تتجاوز مجرد توليد النصوص. لكن النجاح النظيف من النهاية إلى النهاية لا يمكنه تحديد مصدر مشاكل استدعاء الأدوات أو كيفية انتشارها. هنا يأتي دور
ToolRobustBench، الذي يمثل معيارًا تشخيصيًا مبتكرًا وواضحًا لوكلاء استدعاء الأدوات. هذه الأداة الجديدة تسهل على الأنظمة تحديد المشكلات التي قد تطرأ أثناء عملية استدعاء الأدوات، بدءًا من اختيار الأداة وحتى معالجة المدخلات التي تتلقاها.

يتضمن ToolRobustBench أربع عائلات من الاضطرابات التي تتماشى مع مسار استخدام الأداة: اضطرابات واجهة الأداة، ونية المستخدم، ومدخلات/ملاحظات الأداة، واضطرابات بيئة التنفيذ. تساعد هذه العائلات في تحديد الفشل في اختيار الأداة، وتأصيل المخطط، وربط المعطيات، ومعالجة مخرجات الأداة، كما أنها تسهم في تحديد فعالية المهام من النهاية إلى النهاية.

في تجارب أجريت على 15,456 حالة عبر سبع نماذج، و16 أداة محلية مختارة، وأربع عائلات من الاضطرابات، أظهرت النتائج أداءً عالياً ولكنه غير متساوٍ، بالإضافة إلى تدهور كبير في المتانة، مع وقوع اضطراب مدخلات/ملاحظات الأداة كونه العقبة الرئيسية.

تكشف تجارب مختلطة العائلات أن أنماط الفشل غير المضافة لا يمكن تفسيرها من خلال النتائج الفردية للعائلات، مما يجعل
ToolRobustBench مرجعًا محوريًا لفهم المتانة والقدرة على تشخيص المشاكل بخلاف الأداء النظيف لاستدعاء الأدوات. إن الأداة الجديدة ستفتح آفاق جديدة لتحسين أساليب استخدام أدوات الذكاء الاصطناعي، مما يعزز من كفاءتها ويضعها على طريق التقدم.