ظهرت في الآونة الأخيرة دراسة مثيرة من arXiv تُبرز مشكلة شائعة في تقييم أداء نماذج اللغة الكبيرة (Large Language Models)، حيث تكشف أن الدرجات التي تتلقاها هذه النماذج في اختبارات الخيارات المتعددة (Multiple-Choice Questions) قد تتداخل مع القدرة المعرفية للنموذج بسبب تأثير ترتيب الخيارات. الهدف من هذه الدراسة هو اختبار ما إذا كان منع النموذج من رؤية علامات الخيارات أثناء التزامه بالإجابة يمكن أن يخفف من هذا التأثير وتحسين الأداء.

اختبرت الدراسة استراتيجيتين مختلفتين لمكافحة التحيز الناتج عن ترتيب الخيارات. الأولى كانت تعتمد على تقنية "التوليد ثم المطابقة"، بينما الثانية كانت ترتكز على تقييم الخيارات بشكل منفصل، وهي طريقة مصممة أصلاً لعدم التأثر بالموضع.

لكن المفاجأة كانت أن أيًا من هذه الاستراتيجيات لم يُظهر تحسينات موثوقة في دقة النتائج. ولتفسير ذلك، عرض الباحثون تحليلًا كاملاً أظهر أن العقبة الرئيسية تكمن في رفض عرض الخيارات، وليس في خطوة المطابقة. الوحيد الذي يتطابق باستمرار مع المعايير الأساسية هو تكوين يظهر النموذج جميع الخيارات مرتبطة بأداة مطابقة من نماذج اللغة الكبيرة.

على الرغم من ذلك، فإن التخلص من تأثير الترتيب لم يؤدِّ دائمًا إلى زيادة موثوقة في الدقة. بل وُجد أن التبديل الدوري لترتيب الخيارات في بعض الحالات يحسن الأداء بشكل أفضل. وعند استخدام نماذج اختبار من مرحلتين، فشلت مقاييس التوازن المجمع للتذكر وقياسات مباشرة لحساسية السؤال في تقديم تحييد موثوق.

هذه النتائج تدعو الباحثين والممارسين في مجال الذكاء الاصطناعي لإعادة التفكير في كيفية تصميم اختبارات تقييم نماذج اللغة الكبيرة، مما قد يُحدث تأثيرًا كبيرًا على كيفية قياس وتطوير هذه النماذج في المستقبل.