في ظل التوسع السريع لاستخدام وكلاء الذكاء الاصطناعي (AI Agents) في مهام طويلة الأمد، تبرز الحاجة الملحة لتحليل سجلات التنفيذ الضخمة بشكل دقيق وموثوق. إن فهم أسباب الفشل في هذه السجلات يعد أمراً حيوياً لتحسين موثوقية هذه الأنظمة الذكية، حيث يتحول الإشارات الناتجة عن النتائج إلى تدخلات قابلة للتنفيذ.
ومع زيادة حجم البيانات، تصبح المراجعة البشرية غير عملية، مما يزيد من أهمية الحاجة إلى استخدام أساليب التمييز الآلي للأسباب الجذرية (Root-Cause Attribution - RCA). ومع ذلك، تؤدي الطرق الآلية الحالية المستندة إلى نماذج لغوية كبيرة (Large Language Models - LLMs) إلى دقة تشخيص منخفضة، خاصة مع اتساع سجلات التنفيذ، حيث تتوزع المعلومات ذات الصلة على إجراءات بعيدة وغير مرتبطة بالفشل المرئي، مما يجعل تحديد أسباب الفشل مشكلة بحث شاملة.
تستخدم الأساليب الحالية عادةً أحكاماً لمرة واحدة من نماذج اللغات الكبيرة لتشخيص الفشل من سجلات التنفيذ. بينما تكون هذه الأساليب فعالة في المسارات الأقصر، إلا أن الأحكام تميل إلى الانتهاء بسرعة إلى تشخيص محتمل، مما يُسفر عن ترك أدلة حاسمة غير مختبرة في السجلات الأطول.
هنا يأتي دور الإطار الجديد المسمى 'البحث المستمر'. يعمل هذا الإطار التكراري على تحفيز القضاة، على مدار جولات متتالية، لمتابعة البحث عن أدلة تشخيصية غير مشروحة. تم تقييم 'البحث المستمر' عبر أربعة مقاييس قياسية موجودة للتمييز عن الأسباب الجذرية. وإدراكاً لنقص سجلات التنفيذ الضخمة في هذه المقاييس الحالية، تم تقديم 'MegaRCA-Mix' لتقييم RCA على نطاق واسع، والذي يوفر ميدان اختبار صعب يتضمن 50 تجربة فشل تم تحليلها بواسطة البشر، تغطي مهاماً طويلة الأمد وتقنية تنفيذية مكثفة.
عبر مجموعة متنوعة من أدوات القياس وعائلات النماذج، يُظهر 'البحث المستمر' تحسناً متسقاً في أداء التخصيص. على سبيل المثال، زادت دقة النموذج GPT-5.5 بنحو 40%، من 0.349 إلى 0.498 في نتيجة F1 على 'MegaRCA-Mix'. وما يثير الاهتمام أكثر هو أن النماذج المنخفضة المستوى ضمن نفس العائلة قد تتفوق حتى على نظيراتها الأعلى مرتبة، مما يدل على أن البحث الفعّال يفوق في أهميته التحجيم الخام للنموذج.
كيف تحل خوارزمية جديدة مشكلة البحث عن أسباب فشل الوكلاء الذكيين؟
تقدّم هذه المقالة إطار عمل مبتكر يُدعى 'البحث المستمر' يهدف لتحسين دقة تحديد أسباب الفشل في مهام الذكاء الاصطناعي. تساهم هذه الطريقة في تعزيز أداء النماذج وتقليل الفجوات في التحليل.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
