تستخدم أسئلة الاختيار المتعدد (MCQA) بشكل شائع لتقييم نماذج اللغة الضخمة (LLMs) تحت فرضية وجود خيار صحيح من بين الخيارات المقدمة. ولكن ماذا يحدث عندما يجد المستخدمون أنفسهم أمام مجموعات خيارات غير صالحة لا تتضمن أي إجابة صحيحة؟ هذا ما تم بحثه في الدراسة الجديدة التي أضافت بُعدًا جديدًا لتحليل أداء هذه النماذج.
في إطار هذه الدراسة، تم استخدام مجموعة البيانات الرياضية من MMLU-Pro، حيث تم إزالة الخيارات الصحيحة المسماة، مما سمح للنماذج بالاختيار بين الخيارات المتبقية أو إصدار لا أعرف (ABSTAIN). كما تم تطبيق عقوبات على الاستجابات الخاطئة التي تُجبر النموذج على الاختيار من بين خيارات غير صالحة.
ساهمت هذه المنهجية في تقديم تحليل مشروط صحيح، حيث تم تقييم حالات عدم الاستجابة فقط على الأمثلة التي أجابت عليها النماذج بشكل صحيح في البداية. وكشفت التجارب أن علو دقة النموذج في MCQA لا يضمن موثوقية الاستجابة في حالات عدم وجود خيارات صالحة. حتى مع وجود تعليمات وضعت بشكل واضح حول عدم توفر الخيارات الصالحة، استمرت النماذج في إنتاج استجابات غير صحيحة.
تحليل جديد يكشف ضعف نماذج اللغة في الرد على أسئلة متعددة الخيارات بلا خيارات صالحة!
في دراسة مبتكرة، تم تحليل نماذج اللغة الضخمة (LLMs) تحت ظروف عدم توفر خيارات صحيحة للإجابة، مما يكشف عن ضعف في دقتها. تعالوا نتعرف على النتائج غير المتوقعة لهذه الأبحاث وتأثيرها المحتمل على التطبيقات العملية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
