تعتبر نماذج الرؤية واللغة (Vision-Language Models أو VLMs) من الأدوات القوية التي تفتح آفاقاً جديدة لتطبيقات الذكاء الاصطناعي، ولكنها تواجه تحديات كبيرة في فهم التعليمات متعددة الوسائط، خاصةً عندما يتعلق الأمر بالتجميع الدقيق للأجسام. وهذا هو ما يExplor LEGO Co-builder، وهو معيار مبتكر يجمع بين منطق التجميع الواقعي لقطع LEGO والمشاهد متعددة الوسائط المولدة برمجياً.

يزودنا هذا المشروع بمجموعة بيانات فريدة تتعقب الحالات البصرية خطوة بخطوة مع التعليمات الإجرائية، مما يتيح تقييمات مضبوطة لتبعية التعليمات وكشف الأجسام واكتشاف الحالة. بالإضافة إلى ذلك، تم تقديم إطار عمل موحد لتقييم نماذج VLM الرائدة مثل GPT-4o وGemini وQwen-VL في بيئات خالية من التعليمات (zero-shot) وأخرى معدَّلة.

نتائجنا تشير إلى أن الكشف عن الأجسام حقق أداءً مرتفعاً بنسبة 98.16% باستخدام نموذج InstructBLIP المعدل، ولكن فهم المشهد الدقيق والاكتشاف الحالى يتطلب المزيد من العمل. حيث حصل نموذج MiniGPT-v2 المعدل على نتيجة F1 بلغت فقط 37.52% لتحديد الكيانات المرتبطة بالثيمات، حتى النماذج المتقدمة مثل GPT-4o حققت 40.54% فقط في اكتشاف الحالة.

هذا يكشف عن الفجوات في الفهم الدقيق للمشاهد بين النماذج الموجودة. ولتسهيل الأبحاث المستقبلية حول المساعدات متعددة الوسائط المدعومة بواسطة العمليات الواقعية، سنقوم بإصدار معيار العمل، ومجموعة الأكواد، وخط الإنتاج.