أظهرت دراسة جديدة تم نشرها على منصة arXiv أن التعليمات من نوع Chain-of-Thought (CoT) قد تؤدي إلى تشوهات كبيرة في تقييم النماذج اللغوية للرؤى (Vision-Language Models) عندما يتم استخدام أسلوب تقييم معين. تُعرف هذه الظاهرة بـ CoT-prefix scoring، حيث يقوم المصنف بإضافة عنصر تفكير قبل أن يقوم النموذج بإنشاء تبرير للإجابة.
في تجارب على مجموعة بيانات ScienceQA، لوحظ أن أداء نموذج Qwen2.5-VL-7B قد تراجع من نسبة دقة 80.76% إلى 45.48% عند استخدام هذا الأسلوب. الغريب أن 93.54% من التوقعات التي استخدمت أسلوب تقييم CoT-prefix اختارت الخيار الأول، مما يشير إلى وجود تحيز في النتائج.
توفر تحليلات الطبقات والبيانات توضيحات حول هذه الفجوة، حيث تميل المعلومات إلى الظهور في طبقات متأخرة بينما تتجه الاحتمالات نحو رموز استمرارية معينة. على الرغم من اختلاف درجات التأثير عبر مجموعات البيانات والنماذج، إلا أن النتائج توضح بجلاء أن الاستعانة بأسلوب تقييم CoT-prefix يمكن أن تؤدي إلى تداخل بين المعرفة النموذجية وآليات التقييم، مما يستدعي الحذر عند استخدامه.
يتضمن هذا الاكتشاف دعوة للباحثين والمطورين لإعادة التفكير في كيفية تقييم نماذج الذكاء الاصطناعي، وضمان توافق نتائج التقييم مع ما تقدمه النماذج بالفعل.
عندما تشوّه التعليمات العصبية نتائج النماذج اللغوية: اكتشاف جديد مثير!
يكشف الباحثون عن تأثير التعليمات من نوع Chain-of-Thought على تقييم النماذج اللغوية للرؤى في دقة النتائج. هذا الاكتشاف يسلط الضوء على الفجوة الكبيرة بين المعرفة النموذجية وآليات التقييم.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
