مع التقدم السريع في نماذج اللغة البصرية (Vision-Language Models - VLMs)، أصبحت القدرة على تنفيذ التعليمات أحد المؤشرات الرئيسية لثباتها وعمليتها. وللأسف، فإن المعايير الحالية للاختبارات متعددة اللغات لا تزال تعاني من محدودية تغطية اللغات ونقص السيناريوهات المتعلقة بالأمان. ولتجاوز هذه القيود، تم تقديم نموذج MM-IFEval-Pro الذي يعد معياراً متقدماً يجمع بين مهام اللغة الصينية والإنجليزية بالإضافة إلى حالات خطف التعليمات المتنوعة.

يتكون نموذج MM-IFEval-Pro من أربعة فئات رئيسية للمهمات و24 فئة فرعية، بالإضافة إلى 8 فئات تعليمات مع 52 فئة فرعية، بحيث تحتوي كل عينة على متوسط يبلغ 3.0 قيود، مما يُحاكي بشكل واقعي سيناريوهات تعليمات معقدة. كما قمنا بإنشاء مجموعة بيانات للتدريب المستند إلى التعلم المعزز، تم تعزيزها بتعليمات صينية ومعادية، مما أدى إلى تحسين أداء النموذج في MM-IFEval-Pro ونقل فعاليته إلى المعايير الرئيسية الأخرى. يُظهر هذا النموذج قدرة قوية على التعميم عبر المهام واللغات، مما يشير إلى مستقبل مشرق للأداء وتطبيقات الذكاء الاصطناعي.