في عالم الذكاء الاصطناعي، تُعتبر نماذج اللغات متعددة الأبعاد (Multimodal Large Language Models - MLLMs) أحد التطورات المثيرة التي تحقق تقدمًا كبيرًا في المهام المتعلقة بالرؤية واللغة. ومع ذلك، يبقى التساؤل حول موثوقيتها في البيئات الحرجة من السلامة دون دراسة كافية. هذا ما تناولته الدراسة الحديثة التي قدمت معيار SAFIRE، الذي يعد معيارًا ضخمًا لفهم حرائق الدخان في نماذج MLLMs.

يستفيد معيار SAFIRE من مجموعة بيانات ضخمة، تضم 83,000 صورة مشروحة من 20 سيناريوً مختلفًا، إلى جانب 193,000 سؤال خيار متعدد تم إنتاجه من مجموعة مكونة من 9,700 صورة. حيث يركز المعيار على 10 أبعاد تقييمية تبدأ من الإدراك الأساسي وصولًا إلى التفكير المتقدم.

نظام التحقق المتعدد المراحل المعتمد على GPT-5.4، والذي يستند إلى تصويت الأغلبية من MLLMs، يضمن جودة التوضيح والتصنيف. لكن تقييم 10 نماذج MLLMs مفتوحة المصدر (بين 8 مليار و38 مليار وحدة) كشف النقاب عن دقة متوسطة بلغت 61.9%، مما يبرز الفجوات الكبيرة في التفكير المتعلق بالسلامة.

الأكثر إثارة للاهتمام أن تعديل وحدات الرؤية باستخدام 7% فقط من بياناتنا الخاصة، أدى إلى تحسين دقة تصنيف مشاهد الحرائق من 20.1% إلى 64.5%، مما يدل على أن البيانات المحسنة بعناية يمكن أن تحقق مكاسب كبيرة حتى في حالات محدودية حجم البيانات.

هل يمكن أن تمثل SAFIRE خطوة جديدة نحو تحسين أمان الناس خلال الكوارث؟ كافة مجموعات البيانات، النماذج، والرمز البرمجي متاحة هنا.