في عالم الذكاء الاصطناعي، يبدو أن نماذج اللغات الضخمة (LLMs) أصبحت أداة فعالة، لكن تقييم أدائها لا يخلو من التحديات. تشير دراسة حديثة إلى أن نجاح نموذج اللغة كحكم يعتمد بشكل كبير على مدى توافقه مع آراء البشر. لكن في كثير من الأحيان، لا تسمح الميزانيات المتاحة لمشاريع التعليق بتقييم كل عنصر عدة مرات.

تظهر الأبحاث أن ندرة التداخل في البيانات تُعتبر العامل الحاسم الأول في اتخاذ القرارات الخاطئة. فحينما يصل التداخل بين التقييمات إلى 5% فقط، ترتفع معدلات اتخاذ قرارات خاطئة إلى 25%، كما تزداد احتمالية اختيار الجهة الحكم الخطأ بين عشرة مرشحين إلى 65%.

تتضمن الأبعاد القابلة للتطبيق لتحسين هذه التقييمات كل من كمية التداخل وتخصيصه. بالنسبة لكمية التداخل، أثبت الباحثون وجود صيغة كمية دنيا حيث يكفي تداخل بمعدل 0.25 ليكون الحكم غير الحدود. بينما تبقى الحالات الحدودية صعبة بشكل أساسي. أما فيما يتعلق بالتخصيص، فقد أثبتت خطة التصنيف ذات التكلفة الصفرية أنها تقلل من معدلات الرفض الخاطئة إلى نصف نسبتها عند عينة عشوائية، شريطة أن تكون طبقات البيانات مفيدة.

لقد تم التحقق من النتائج على عشرة نماذج من LLM عبر أربعة معايير تقييم تشمل التقييم البصري، والسببية، والتلخيص، مما يجعلها دراسة شاملة لمجال التقييم والتوظيف في الذكاء الاصطناعي. هذه المعطيات تفتح المجال لمزيد من البحث والتحليل حول كيفية تحسين دقة التقييم.

ما رأيكم في تحديات تقييم نماذج الذكاء الاصطناعي؟ شاركونا أفكاركم وتجاربكم في التعليقات.