في خطوة ثورية نحو تحسين تفاعل الذكاء الاصطناعي مع النماذج الهندسية، تم إطلاق معيار DrawingVQA، الذي يعد الأول من نوعه لتقييم نماذج اللغات متعددة الأنماط (Multimodal Large Language Models) على الرسومات الإنشائية الواقعية.

تُعتبر تلك الرسوم أداة أساسية في مجالات الهندسة المعمارية، والهندسة المدنية، وغيرها من الممارسات الهندسية. وبفضل تداخلها بين الهندسة المجردة، الرموز، البيانات الجدولية، التعليقات، والنصوص المتخصصة، فإن الرسومات الإنشائية تشكل ميداناً معقداً يُعد ضروريًا لعمليات البناء.

يهدف DrawingVQA إلى سد هذه الفجوة من خلال توفير 33 رسماً إنشائياً مصدَّقاً و92 زوجاً من الأسئلة والأجوبة المعدة بعناية، تغطي ثلاثة مستويات من التفكير الاستدلالي: الفهم الإدراكي، التفسير السياقي، وتفكير الخبراء.

لاختبار قدرات النماذج، تم تقديم إطار تصنيف مزدوج لتحليل الأداء عبر سبعة أبعاد في مجالات الهندسة الإنشائية وأربعة أبعاد متعلقة بقدرات نماذج اللغة الكبيرة. تمثل هذه المبادرة الأولى من نوعها التي تربط بين عمليات الهندسة وخبرات التخيل في مجال الذكاء الاصطناعي.

تظهر التقييمات التي أجريت على نماذج MLLMs المتطورة وجود فجوة كبيرة بين أداء النماذج وأداء الخبراء، خاصة في مستويات التفكير الأعلى. يُظهر هذا المعيار أهمية البحث في تطوير الاستدلال متعدد الأنماط، بهدف تحسين دمج الفهم المدفوع بالذكاء الاصطناعي في عمليات الهندسة الواقعية.