تعد نماذج اللغات الضخمة (Large Language Models) من أبرز الابتكارات في مجال الذكاء الاصطناعي، إلا أن تحليل موثوقية تقييماتها يثير الكثير من التساؤلات. في الدراسة الجديدة المنشورة عبر arXiv، تم استعراض كيفية تقييم التقنيات الحديثة عبر دراسة معمقة لعدة نماذج مفتوحة وذات معلمات مختلفة تتراوح من 8 إلى 675 مليار.
ارتكزت الدراسة على تحليل هياكل التوجيه المستنبطة بواسطة نماذج اللغات، حيث تم تقييم النتائج المستخلصة من مجموعات محدودة من الأوامر، مما أدى إلى نتائج غير مستقرة. أظهرت الدراسة أن استدعاءات متطابقة للنموذج لا تعيد بالضرورة نفس الهيكل، مع وجود مستوى متوسط للتطابق يتراوح بين 0.39 إلى 0.96. في الواقع، فإن 72% من خلايا التقييم لم تتمكن من الوصول إلى مدى مثالي.
تعتبر هذه النتائج مثيرة للقلق، حيث توضح أن التقييمات الحالية قد تبدو أكثر دقة مما تدعمه الأدلة الفعلية. ومن المثير للاهتمام أن الدراسة أوصت بضرورة الإبلاغ عن وثيقة استقرار الترتيب، مصدر خلايا النتائج، ومقارنات حساسية معينة لضمان النزاهة في تقييم النماذج.
بينما يحتفظ الأسوأ مرتبة بنسبة 86% من المرات، فإن تحديد الأفضل يبقى غير موثوق، مما يدعو الخبراء والمطورين إلى إعادة التفكير في الأساليب المستخدمة في مثل هذه التقييمات. هل نحن مستعدون لاستقبال نتائج لا تعكس الواقع بدقة؟
ما رأيكم في هذه التطورات ودلالاتها؟ شاركونا في التعليقات!
كيف نقيّم موثوقية استنتاجات نماذج الذكاء الاصطناعي؟ دراسة للهيكل التنظيمي للاختبارات
تستعرض الدراسة مدى ثبات استنتاجات نماذج الذكاء الاصطناعي الكبيرة من خلال تحليل دقيق للهياكل المُستنتجة. تكشف النتائج عن وجود تفاوت كبير في دقة التقييمات التقليدية، مما يثير تساؤلات حول موثوقيتها.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
