في عالم الذكاء الاصطناعي، تُعتبر مشكلات فشل الوكلاء (Agents) من التحديات الكبيرة التي تواجه مطوري الأنظمة. غالبًا ما يتم تقييم هذه المشكلات بناءً على نتائج نظامية، مما يُخفي مصدر الخطأ الحقيقي. لا يقتصر الأمر على تحديد الخطأ، وإنما يمتد ليشمل معرفة نوع التدخل المطلوب لتحسين أداء النظام. فهل يعاني الوكيل من خطأ في النموذج نفسه، أو أنه ناجم عن تصميم الحاضنة (Harness) أو إعادة تصميم البيئة (Environment)?

نقدم لكم اليوم تصنيفًا جديدًا يركز على التفاعل، يحدد الأخطاء وفقًا للتفاعلات التي تحدث، مما يسهل تحديد المسؤولية عن الفشل. لقد قمنا بتنظيم 41 نوعًا من الأخطاء، كل منها مرتبط بحد بين مكونين مختلفين، مع تحديد جانب الخطأ، مما يجعل هذا التصنيف قابلاً للتطبيق بصورة عملية.

يعتبر هذا التصنيف أداة فعالة لتسليط الضوء على المشكلات المختلفة، ففي حالة الأخطاء المتعلقة بالنموذج، يمكن توجيه الجهود نحو تحسين النموذج، أما الأخطاء المرتبطة بالحاضنات، فهي تشير إلى الحاجة لإصلاحات في الهيكلية أو دمج الأدوات، فيما تكشف الأخطاء المرتبطة بالبيئة عن شروط التقييم التي تحتاج إلى إعادة تصميم.

تم اختبار هذا التصنيف عبر أنظمة وكيلة متنوعة، من المساعدين البرمجيين إلى المساعدات الشخصية طويلة الأمد، مما يضمن تطبيقه على نطاق واسع. استخدمنا أمثلة عملية من معايير عامة، وبطاقات نظامية، وتقارير منشورة لتحديد فعالية التصنيف.

تظهر النتائج أن هذا النظام الجديد يتمتع بإمكانية تكرار مرتفعة، حيث يُظهر أحد نماذج التقييم أقوى توافق مع التصنيفات البشرية، مما يُشير إلى أن هذه الفئات تمثل بنية مشتركة بدلاً من تفضيلات فردية.