في عالم الذكاء الاصطناعي، يعد تقييم الأداء من أهم التحديات التي تواجه النماذج اللغوية الضخمة (Large Language Models). قد تكون دقة هذه النماذج في حل المسائل الرياضية محدودة بسبب نقص المعايير المرجعية والحالة العشوائية الموجودة في نماذجها، مما يؤدي إلى تقديرات دقة عالية التباين وترتيبات غير مستقرة بين المنصات المختلفة.
لكن ماذا لو أخبرناك أنه رغم أن النموذج قد يفشل في تقديم الإجابة النهائية الصحيحة، إلا أنه يمكنه تقديم إشارات مقارنة موثوقة تشير إلى أي من الحلين المقترحين أفضل؟
استغل الباحثون هذه الملاحظة لتصميم إطار تقييم إحصائي فعال يمزج بين النتائج المصنفة التقليدية وإشارات المقارنة الثنائية الناتجة عن ترك نماذج الذكاء الاصطناعي تحكم على سلاسل التفكير المساعدة. من خلال التعامل مع هذه الإشارات كمتغيرات تحكم، طور الباحثون مقدرًا شبه باراميتري يعتمد على وظيفة التأثير الفعّالة (EIF).
تمكن هذا المقدر من تحسين دقة الترتيب بشكل كبير، حيث تزداد المكاسب كلما زاد ضجيج مخرجات النموذج. وفي تجارب أجريت على عدة مجموعات بيانات مثل GPQA Diamond وAIME 2025 وGSM8K، أثبتت نتائج هذه التجارب تحسينات ملحوظة في تقدير الأداء وترتيب النماذج، خاصةً في الحالات التي تتسم بأحجام عينة صغيرة حيث يكون التقييم التقليدي أقل استقرارًا.
من الواضح أن هذا العمل يفتح آفاقاً جديدة في محاولة فهم وتقويم قدرات النماذج اللغوية الضخمة، ويشجع الباحثين على الانخراط في أساليب تقييم جديدة ومبتكرة.
تحليل نماذج لغوية ضخمة: تقييم رياضي مبتكر للحسابات بدقة عالية!
يستعرض البحث الجديد إطاراً تقييمياً مبتكراً لتحسين دقة تقييم النماذج اللغوية الضخمة في حل المسائل الرياضية. باستخدام إشارات مقارنة ثنائية، تم تحقيق تحسينات كبيرة في دقة التصنيف ونوعية النتائج.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
