في عالم التكنولوجيا الحديثة، تتطور نماذج اللغة الكبرى (Large Language Models) بسرعة مذهلة، ولكن تحليل أسباب الأعطال (Root Cause Analysis - RCA) يمثل تحدياً خاصاً. هنا يأتي دور ORCA-bench، الذي يعد Benchmark جديداً يهدف إلى اختبار جاهزية هذه النماذج في بيئات الإنتاج الفعلية.

تُدعم ORCA-bench بنظام خدمات مصغرة مُعدّل بواسطة OpenTelemetry، حيث توفر ستة أيام من البيانات الفعلية المتمثلة في القياسات، السجلات، والمسارات، مما يسمح للنماذج بالتعامل مع تحديات تحليل الأعطال بناءً على تقارير مستخدمين غامضة.

هذا المشروع يتيح الوصول إلى 1,079 مهمة تحليل جذرية تختلف في تحديد التقارير، وقت الاكتشاف، وسيناريوهات الأعطال المتزامنة. الأعراض الحقيقية تم تنسيقها والموافقة عليها من قبل خبراء في تعزيز موثوقية الأنظمة (SREs)، مما يضمن دقة البيانات المستخدمة.

الكشف عن النتائج المذهلة: حققت أفضل النماذج دقة تحليل تصل إلى 25.3% في المهام المتوسطة، و10% فقط في المهام الصعبة. وحتى أسوأ النماذج كانت تشير إلى أسباب غير محتملة في 40% من التقارير. يُظهر ذلك الفجوة الكبيرة التي لا تزال قائمة، مما يدل على الحاجة لتعزيز فعالية نماذج اللغة في بيئات الإنتاج المعقدة.

يمكن الاطلاع على مجموعة البيانات العامة الخاصة بـ ORCA-bench عبر الرابط هنا. نحن في انتظار تحسين الفعالية وتعزيز الأداء بحيث يمكن الوثوق بالنماذج في تعزيز موثوقية الأنظمة الحقيقية. فهل تعتقد أنه يمكن لهذه النماذج أن تتجاوز هذه الفجوات الكبيرة؟ شاركونا آرائكم في التعليقات!