في عالم متزايد التعقيد من تكنولوجيا المعلومات، تبرز أهمية الذكاء الاصطناعي (Artificial Intelligence) كأداة مساعدة في تشخيص أعطال الشبكات. إلا أن الوسائل الحالية في تقييم فعالية وكلاء الذكاء الاصطناعي تقتصر غالباً على مواقف مثالية، مما لا يعكس التحديات الفعلية التي تواجه المتخصصين في المجال.
مع ظهور معيار FaulT-Bench، يتم تقديم خطوة جديدة تعزز من دقة وكفاءة هؤلاء الوكلاء. يتضمن FaulT-Bench تقييمًا من خلال 200 سيناريو لعلاج الأعطال، يتنوع عبر ثمانية طوبوغرافيات شبكية، مع التركيز على حالات حقيقية تتضمن أعطالًا حقيقية وتقارير خاطئة.
ويهدف هذا المعيار إلى عزل تأثير صياغة الطلبات (tickets) على دقة التشخيص، حيث تم إعادة صياغة 72 طلبًا خاطئًا إلى خمسة شخصيات مختلفة تُظهر مستويات متفاوتة من الثقة والتفاصيل القابلة للتحقق. من خلال استخدام الأداة NIKA، يقوم المعيار بتقييم استجابات وكلاء الذكاء الاصطناعي مثل SADE وReAct وClaude Code عبر جودة النتائج والتشخيص والعلاج. وكشفت النتائج أن أداء هؤلاء الوكلاء ينخفض بشكل حاد عند ورود تقارير خاطئة، حيث يقومون بسلسلة من التقييمات حتى يتوصلوا إلى أسباب فعلية قد تكون صحيحة.
تعتبر النتائج التي تم الحصول عليها عبر FaulT-Bench نقطة انطلاق جديدة لفهم أكثر تعقيدًا لكيفية عمل أنظمة الذكاء الاصطناعي في بيئات العمل المتقلبة، مما يساعد على تطوير أنظمة قادرة على التفكير بشكل موثوق عند التعامل مع تقارير منخفضة الجودة في عالم التشخيص الشبكي.
FaulT-Bench: معيار جديد لتقييم قدرة وكلاء الذكاء الاصطناعي في تشخيص أعطال الشبكات!
يقدم بحث جديد معيار FaulT-Bench لتقييم قدرة وكلاء الذكاء الاصطناعي على تشخيص أعطال الشبكات بدقة. يركز المعيار على سيناريوهات معقدة تشمل تقارير خاطئة، مما يعكس التحديات الحقيقية في بيئات العمل.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
