في خضم التحولات السريعة التي يعيشها عالم الذكاء الاصطناعي، يظهر إطار عمل جديد يسمى "OrchestraBench"، والذي يركز على تقييم أسباب فشل التنسيق بين الوكلاء المتعددين (Multi-Agent Orchestration). تتقدم هذه الأطر من المرحلة التجريبية إلى الإنتاج، لكن غالبًا ما تفتقر تقارير الأداء إلى تحديد أسباب الفشل ومواضع الانهيار.

تهدف "OrchestraBench" إلى تحسين طريقة تقييم الفشل من خلال تقديم مقاييس مبدئية مثل "نطاق الانهيار" (cascade radius) وكفاءة الاستجابة لكل حالات الفشل. يتم ذلك عبر استخدام نظام ممتد وقابل للتكرار يعمل على محاكاة فشل التحكم.

من خلال هذا النظام، تمت مقارنة سياسات التوجيه باستخدام فحوصات موثوقة، وكشفت النتائج أن نموذج التوجيه القائم على استنتاج النوايا (intent-reasoning model) سجل دقة تصل إلى 100% بينما عانى نموذج توجيه الكلمات من فشل تام في حالات معقدة.

عبر تنفيذ تجارب موثوقة باستخدام وكيل "Claude"، تمكنت الدراسة من تحديد ثلاث مستويات للتعامل مع الفشل، مع مراعاة استراتيجيات مختلفة للإصلاح. كما أظهرت النتائج أن التعرف على الفشل وإسناده يعد أمرًا ضرورياً للحد منه.

بصفة عامة، يقدم "OrchestraBench" أدوات قوية لتحليل الفشل واستراتيجيات الاسترداد، مما يفتح آفاقًا جديدة لتحسين أداء التنسيق بين الوكلاء المتعددين وتعزيز فعالية التطبيقات الذكية.