في عالم الذكاء الاصطناعي المتطور، تعتبر نماذج اللغة المرئية (Vision-Language Models) من أهم الابتكارات التي تجمع بين تحليل الصور وفهم اللغة، مما يمكنها من تقديم تفسيرات طبيعية (Natural Language Explanations) قد تبدو معقولة لكنها غالباً ما تكون غير متسقة مع الأدلة البصرية التي تستند إليها.
وللتعامل مع هذه الفجوات في الموثوقية، تم تقديم بروتوكول جديد يُسمى اختبار الفجوات من خلال التفسير القائم على الاختبارات المضادة (Explanation-Driven Counterfactual Testing - EDCT). يعتمد هذا البروتوكول على التدخل لاستخراج المفاهيم البصرية الواردة في تفسير النموذج، ثم تطبيق تعديلات بسيطة موثوقة عليها لاختبار ما إذا كانت الإجابات والتفسيرات الناتجة لا تزال متسقة مع الصورة المعدلة.
من خلال هذا البروتوكول، تم إنشاء EDCT-Bench، وهو معيار شامل يغطي ثلاثة مجالات تكاملية: الأسئلة البصرية المعقدة (OK-VQA)، القيادة الحساسة للسلامة (DriveLM)، والتفكير المكاني ثلاثي الأبعاد (3DSRBench).
عند تقييم مجموعة من نماذج اللغة المرئية، يكشف EDCT عن فجوات كبيرة في الموثوقية، حيث تنتج النماذج استجابات كثيراً ما تكون غير متسقة مع التغييرات البصرية التي تم التحقق منها. وأخيراً، يشير بحثنا حول تحسين الأداء إلى أن العمليات الناتجة عن EDCT تقدم إشارات تدريبية ذات تأثير كبير.
من الواضح أن تعزيز موثوقية نماذج اللغة المرئية يمكن أن يُحدث ثورة كبيرة في قدرة هذه الأنظمة على فهم الصور بطريقة موثوقة. ولكن، ما هي أهدافك استخدام هذه النماذج؟ شاركونا آرائكم وتعليقاتكم في الأسفل!
فتح آفاق جديدة في نماذج اللغة المرئية: اختبار الفجوات الموثوقية من خلال EDCT-Bench!
تعتبر نماذج اللغة المرئية (VLMs) محورية في تقديم تفسيرات قابلة للفهم، ولكنها قد تحتوي على فجوات في الموثوقية. تقدم EDCT-Bench بروتوكولاً جديداً يكشف عن هذه الفجوات ويعزز من دقة النماذج.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
