في ثورة جديدة في عالم الذكاء الاصطناعي، تم تقديم معيار MMArch الذي يعد بارقة أمل في اختبار قدرات نماذج اللغات متعددة الوسائط (MLLMs) في مجالات الهندسة المعمارية. بينما أثبتت هذه النماذج قوتها في تحليل الصور الهندسية، فإن المعايير الحالية تفتقر إلى الاختبارات الشاملة التي تتطلب دمج الأدلة البصرية مع المبادئ الهندسية للوصول إلى استنتاج منطقي.

يشمل معيار MMArch عشرة مجالات فرعية، حيث تم بناؤه بالكامل من الشكلات الواردة في الأوراق العلمية المحكمة. يحتوي المعيار على 1212 عنصرًا من الأسئلة قصيرة الإجابة، تم إنتاجها بواسطة آلية كتابة-تخطيط منفصلة وتم التحقق من صحتها من خلال فحص آلي وتصميم علمي شامل وراجع من قبل خبراء.

يهدف MMArch إلى تقييم قدرة النماذج على إدراك الأدلة ذات الصلة، وتحديد المبادئ الحاكمة، وتطبيقها، بدلاً من استغلال طرق تحليل أحادية وثيقة أو صورة واحدة. في إطار تقييمه، تم اختبار 18 نموذجًا من نماذج اللغات متعددة الوسائط، وجاءت النتائج مخيبة للآمال: حيث حقق أقوى نموذج مفتوح المصدر حوالي 30%، بينما حقق أفضل نظام خاص 52%، مقارنةً بالخبراء البشريين الذين حققوا 95%، بفارق يزيد عن أربعين نقطة.

كشفت تحليلات الأخطاء أن نقاط الضعف تتركز في تطبيق المبادئ ودمج الأدلة عبر الشكلات، مما يشير إلى مساحة كبيرة للتطورات المستقبلية في هذا المجال. لا تفوت فرصة الاطلاع على الشيفرة والبيانات المتاحة عبر الرابط: https://dcx-swjtu.github.io/[MMArch/].