في عالم الذكاء الاصطناعي، أصبحت نماذج اللغات الضخمة (LLMs) لاعباً أساسياً يعتمد عليه في اتخاذ القرارات الحاسمة. ولكن، ماذا إذا كانت هذه الأنظمة تعاني من مشكلة جوهرية في تقدير ثقتها الخاصة؟ تكشف دراسة حديثة أجرتها مجموعة من الباحثين عن نتائج مثيرة للقلق في هذا السياق.
تتعلق الدراسة بلعبة شطرنج تعتمد على معلومات مخفية، حيث يمكن نقل الوضع الملكي سراً بين قطع اللعب. تم اختبار الأنظمة على مدى جولتين مستقليتين، وأظهرت النتائج أن النماذج كانت موثوقة في تقديراتها فقط في حالة نجاح واحد من كل 62 مقارنة عالية للثقة (≥0.5).
تشير النتائج إلى أن معظم الأخطاء تأتي من حالات الثقة العالية المستندة إلى معلومات غير دقيقة، حيث يتركز 99.3% من عدم تطابق التقديرات في النتيجة الأصلية و98.7% في النسخة المكررة.
مواضيع مهمة أخرى تناولتها الدراسة تشمل تقييمات الاعتماد التقليدية مثل القانون والكلفة والسرعة، حيث يمكن أن تنفصل هذه القيم تمامًا عن جودة الثقة. وعلى الرغم من ذلك، يُظهر نموذج معين إمكانية الفوز رغم ضعف تقديراته، مما يعني أن الاعتماد على النتائج فقط لا يكفي للكشف عن مشكلات الثقة.
بمعنى آخر، هل يمكن أن يكون مستوى الثقة المضاد هو الاستخدام الرئيسي في اتخاذ القرارات للحفاظ على دقة الأداء؟ يجب على الباحثين ومسؤولي الصناعة إعادة التفكير في كيفية تقييم هذه الأنظمة وتطوير استراتيجيات أكثر شمولية لتحسين أدائها.
هل تكمن الثقة في الأداء الفعلي؟ أسرار تتكشف في نماذج اللغات الضخمة (LLMs)
كشف دراسة جديدة عن فشل نماذج اللغات الضخمة (LLMs) في تقدير ثقتها عند اتخاذ القرارات المصيرية في لعبة الشطرنج. مما يعكس ضرورة إعادة النظر في كيفية تقييم هذه الأنظمة المعقدة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
