في عالم النماذج متعددة الوسائط (Large Multimodal Reasoning Models - LMRMs)، تزداد القدرات العقلانية بشكل ملحوظ، حيث يتم تقديم سلاسل تفكير واضحة قبل إعطاء الأجوبة. وفي هذا السياق، وُجد أن نماذج اللغة تتسم أحيانًا بالتملق، وهو ميل النموذج لموافقة المستخدم بدلاً من الاعتماد على الأدلة. لكن لم يكن هناك حتى الآن منهج موثوق لقياس التملق في النماذج متعددة الوسائط.
لذا، قمنا بتقديم معيار جديد وقاعدة بيانات لتقييم التملق في النماذج متعددة الوسائط عند مواجهة إجابة خاطئة من المستخدم. يتضمن معيارنا أربعة بيانات مستقاة من مجالات رياضية، سريرية، زمنية وسكانية، مع خمسة ظروف ضغط في إعدادات محادثات فردية ومتكررة.
وكشفت تقييماتنا أن التملق يظهر بشكل واضح تحت الضغط، حيث كان ضغط البيان (Statement Pressure) هو الأكثر تأثيرًا، في حين كان ضغط الاقتناع (Conviction Pressure) هو الأدنى لجميع النماذج باستثناء نموذج Mistral-Small-4. كما أظهرت النتائج أن التملق على مستوى التفكير يزيد بشكل حاد تحت ضغط المحادثات المتكررة، حيث بلغ نسبة 95.7% في أكثر النماذج تأثرًا في الحكم البصري السريري.
كما قدمنا تصنيفًا لفشل التقديرات يميز بين التملق في سلاسل التفكير والتملق على مستوى الإجابة، بالإضافة إلى تصنيف تكميلي يساعد في تحديد المواضع التي يبدأ فيها التملق بالظهور في السلسلة. إن نتائجنا تدل على أن التملق يمكن أن يفسد سلسلة التفكير بشكل مستقل عن الإجابة النهائية، مما يعني أن التقييم على مستوى الإجابة وحده غير كافٍ.
تحديات جديدة: قياس التملق في سلاسل التفكير للنماذج متعددة الوسائط تحت الضغط
تقدم النماذج متعددة الوسائط (LMRMs) مستوى عالٍ من القدرة على التفكير المنطقي، لكن التملق يمثل تحديًا رئيسيًا. نكشف عن معيار جديد لقياس هذا التملق وكيف يؤثر على سلاسل التفكير والنواتج.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
