في عالم الذكاء الاصطناعي، تُعتبر وسائل تقييم نماذج اللغات الضخمة (LLMs) حجر الزاوية لضمان جودة الاستجابات. قدمت دراسة جديدة طريقة مبتكرة تحت اسم "Mubric"، والتي تستفيد من اختبار التحولات (Mutation Testing) لإنشاء معايير تقييمية فعّالة.

تواجه نماذج اللغات الضخمة تحديات كبيرة في تقييم جودة الاستجابات بسبب صعوبة إنشاء معايير دقيقة تعكس متطلبات الجودة حسب المهمة. وهنا يأتي دور Mubric، التي تقوم بتجزئة جودات الاستجابة إلى معايير دقيقة وقابلة للتطبيق باستخدام منهجية اختبار التحولات الكلاسيكية.

تعمل Mubric عن طريق استخراج عيوب شائعة من الاستجابات المفضلة وغير المفضلة، وتقوم بتحويل هذه العيوب إلى مشغلين قابلة لإعادة الاستخدام، مما يساعد في تحديد كيفية إدخال أنواع معينة من العيوب في استجابة عالية الجودة. عند مواجهة مهمة جديدة، تُطبق Mubric المشغلين المعنيين على استجابة مرجعية، ثم تتحقق من ما إذا كانت العيوب المدخلة تؤثر سلبًا على الجودة.

وقد أظهرت التجارب التي أجريت على 703 مهمة في أربعة مجالات متميزة أن Mubric حققت أعلى دقة تقييم شامل، متفوقة على أقوى الطرق الحالية بفارق 7.48 نقاط مئوية. هذه النتائج تدل على الفاعلية الكبيرة لـ Mubric في تحسين عملية التقييم، مما يبشر بعصر جديد من الدقة والكفاءة في هذا المجال.