تواجه نماذج الرؤية-لغة الكبيرة (Large Vision-Language Models) مشكلة كبيرة تعرف بالهلاوس البصرية، حيث تتجلى في إخراج محتوى غير موثوق قد يؤثر على التجربة الكلية. في دراسة حديثة، تم تسليط الضوء على هذا التحدي وكيفية معالجته بأسلوب مبتكر ومثير.
تعتبر استراتيجية التخفيف من الهلاوس البصرية عن طريق كتم المكونات المرتبطة بها في التمثيلات الداخلية فكرة شائعة. ولكن، من السهل أن نغفل أن هذه المكونات قد تحتوي أيضًا على معلومات مفيدة، مما قد يؤدي إلى إضعاف قدرات النموذج متعددة الأنماط.
وفي هذا السياق، تظهر تقنية جديدة تُعرف باسم ResOT، التي لا تتطلب تدريبًا مسبقًا. تعتمد ResOT على إصلاح التمثيلات في وقت الاستدلال من خلال محاذاة التوزيع المحلي. بدلاً من تجاهل المكونات الهلوسية تمامًا، تقوم ResOT بإبعاد الاتجاهات الهلوسية السائدة عن الفضاء الفرعي الأمين، مما يشكل فضاء فرعي منخفض الأبعاد للتدخل.
ثم، تستخدم ResOT نقل غاوسي مثالي (Gaussian Optimal Transport) لضبط توزيعات الهلاوس مع التوزيع الأمين. النتيجة هي خريطة تحدد أهداف الإصلاح مع أقل تغيير ممكن في التمثيلات الأصلية.
عند وقت الاستدلال، تتحكم ResOT بطريقة ديناميكية في مدى تحرك كل حالة من حالات الرموز نحو هدفها. وقد أظهرت التجارب مع ثلاثة نماذج代表ية تحسناً ملحوظاً في تقليل الهلاوس البصرية، مع ارتفاع ملموس في جودة التعليق على الصور والأداء متعدد الأنماط عبر العديد من المعايير.
هذه التطورات قد تكون نقطة تحول لهذه النماذج، مما يمثل خطوة كبيرة نحو تحسين التجربة الكلية للمستخدمين في المستقبل. ماذا عنكم؟ كيف ترون تأثير هذه التقنية الجديدة على عالم الذكاء الاصطناعي؟ شاركونا في التعليقات!
إصلاح الخيال الزائف: كيف يمكن لنماذج الرؤية-لغة تقليل التدهور البصري بذكاء!
تمثل الهلاوس البصرية تحدياً كبيراً أمام نماذج الرؤية-لغة الكبيرة، حيث يوضح البحث الجديد طريقة مبتكرة للإصلاح دون الحاجة للتدريب. تعرفوا على تقنية ResOT التي تحقق نتائج مذهلة في تحسين دقة الترجمة!
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
