في عالم الذكاء الاصطناعي، تزايدت تطبيقات نماذج الرؤية واللغة الكبيرة (Large Vision-Language Models) بشكل ملحوظ، خاصةً في التعامل مع المدخلات المتعددة المناظر الملتقطة من زوايا مختلفة. ومع ذلك، تظهر تحديات جديدة على السطح، تتعلق بحدوث أخطاء في الاستجابة بسبب تداخل بصري من نماذج أو زوايا غير مستهدفة. هذه الظاهرة تُعرف باسم الهلوسة متعددة المناظر (Multi-View Hallucination) وتعكس عدم قدرة النماذج الحالية على تقديم استجابات موثوقة في مختلف السياقات.

لتحليل هذه المشكلة بعمق، تم تطوير معيار جديد يُسمى MVH-Bench، والذي يضم 4800 زوج من الأسئلة والأجوبة، تستهدف نوعين من الهلوسة: الهلوسة عبر النماذج والهلوسة عبر الزوايا. توضح النتائج التجريبية أن ظاهرة الهلوسة متعددة المناظر منتشرة بشكل كبير في النماذج الحديثة، مما يستدعي ضرورة إيجاد حلول فعّالة.

لمواجهة هذه التحديات، تم اقتراح تقنية جديدة تُسمى فك التشفير المتباين مع إزاحة المرجعية (Reference Shift Contrastive Decoding - RSCD). تعتمد هذه الطريقة على تقليل التداخل البصري من خلال توليد سجلات سلبية باستخدام تقنيات إخفاء الانتباه. وأظهرت التجارب التي أجريت على MVH-Bench مع نماذج LLaVA-OneVision وQwen2.5-VL أن RSCD حسّنت الأداء بنسبة تصل إلى 25.7 و94.8 نقطة، مما يبرز كفاءة هذه التقنية في معالجة الهلوسة.

بلا شك، يُعَدّ هذا الاكتشاف خطوة مهمة نحو تحسين أداء نماذج الرؤية واللغة، مما يُمكِّننا من الاستفادة بشكل أكبر من الابتكارات في الذكاء الاصطناعي. هل أنت متشوق لرؤية كيف ستغير هذه التقنية مستقبل الذكاء الاصطناعي؟ شاركنا رؤيتك!