في عالم الذكاء الاصطناعي، تعتبر أعطال الوكلاء على المدى الطويل من أبرز التحديات التي تواجه المطورين. ورغم أن تقييم النتائج النهائية لهذه الأعطال يكشف عن النتائج الفاشلة، إلا أنه يترك المطورين أمام صعوبة تحديد مكان الخطأ الفاصل الذي أدى إلى تلك الأعطال. هنا تأتي أهمية الأداة الجديدة LongRCA Bench، التي أحدثت ثورة في طريقة تشخيص الأخطاء.

تتكون LongRCA Bench من 1,140 مسارًا فاشلًا عبر خمسة مجالات دون إدخال أخطاء. تتيح هذه الأداة للمطورين الحصول على تصنيفات مستقلة لكل من الدور المسؤول وأول خطوة جذرية حاسمة. متوسط المسار يتضمن 145 خطوة، بينما لا تتجاوز أعلى دقة للوصول إلى الخطوة الجذرية 13.2%.

كما تم تقديم منهج جديد يسمى Root-Cause Trajectory Attribution (RCTA)، وهو طريقة لا تحتاج إلى تدريب، تقوم باستخراج خطوات الأخطاء المحتملة من ملخصات الأقسام وتتبعها إلى التعليمات السابقة. وبتطبيق نفس البروتوكول والمعايير، حقق RCTA دقة بلغت 51.1% في تحديد الدور المسؤول و24.1% في دقة تحديد الخطوة الجذرية.

تسلط هذه النتائج الضوء على ضرورة تقييم نسبة الإسناد إلى الأدوار المسؤولة وتحديد الخطوات الجذرية بشكل منفصل كأهداف في تشخيص أعطال المسارات الطويلة. في ظل تعدد الاستخدامات والتطبيقات، يبدو أن LongRCA Bench ستكون أداة لا غنى عنها في أيدي المطورين الذين يسعون لتحقيق أداء أفضل لوكلائهم.