في عالم يتسارع فيه الابتكار، نجحت نماذج تحويل النص إلى صورة (Text-to-Image Models) في تحقيق إنجازات مذهلة في تمثيل الأشياء والسمات بدقة. لكن الكيفية التي يمكن بها لهذه النماذج إنتاج استعارات بصرية—صور تعبر عن أفكار مجردة من خلال دمج عناصر تنتمي إلى مجالات مختلفة—لا تزال مسألة غير مُفحصَة بشكل كافٍ.

ولسد هذه الفجوة، تم تقديم VMetaphor-Bench، وهو أول معيار مصمم لتقييم قدرة نماذج تحويل النص إلى صورة على توليد استعارات بصرية. يتضمن هذا المعيار 1,500 استعارة بصرية تم انتقاؤها من صور إبداعية حقيقية، مقسمة إلى ثلاثة مستويات وعشر فئات، حيث يتم إقران كل عينة مع اثنين من النصوص التي تختلف في الدقة.

للقيام بالتقييم، تم تطوير إطار هجين ضمن نموذج MLLM-as-judge، يجمع بين بروتوكول اختيار متعدد الخيارات (Multiple Choice Questions) يحتوي على 9,594 سؤالاً عبر أربعة مستويات من الأصالة الاستعارية، مع بروتوكول تسجيل يعتمد على أبعاد إدراكية.

من خلال تقييم شامل ل11 نموذجاً تمثيلياً، تبين أن حتى النماذج الخاصة الأقوى تكافح مع هيكلة التركيب والتعيين عبر المجالات، وهما عنصران أساسيان للتعبير الاستعاري.

هذا التحدي في توليد الاستعارات المرئية يفتح امامنا طفرة جديدة في الأبحاث المتعلقة بنماذج تحويل النص إلى صورة، مما يجعل هذا المجال موضوعاً مهمًا للمستقبل.