في عالم النماذج اللغوية متعددة الوسائط (Multimodal Large Language Models - MLLMs)، تعتمد العمليات التقليدية غالبًا على ميزة واحدة متأخرة من مشفر الرؤية (Vision Encoder) المجمد، مما يجعلنا نشهد تفويتاً للعديد من الإشارات البصرية الغنية التي يوفرها هذا الطبق. وللأسف، لا تزال هذه النماذج تعاني من ظاهرة الهلوسة غير المدعومة بصريًا، حيث تعتمد في الكثير من الأوقات على أولويات اللغة بدلاً من الأدلة البصرية.

فيما تركزت العديد من استراتيجيات التخفيف السابقة على الجانب النصي ودون تغيير التمثيل البصري، لم تستغل هذه الاستراتيجيات التسلسل الغني للميزات المرمّزة عبر طبقات الرؤية. في هذا السياق، تظهر تقنيات الدمج متعددة الطبقات المحدودة، لكن تفشل في تقديم تطورات ديناميكية، حيث تطبق نفس مزيج الطبقات بغض النظر عن الاستعلام.

لذا، نُقدم تقنية TGIF (Text-Guided Inter-layer Fusion) كحلاً خفيف الوزن يعامل طبقات المشفر كـ "خبراء" عمق، ويتنبأ بدمج ميزات بصرية تعتمد على كل استعلام. TGIF تعكس مبدأ الدمج الخارجي المباشر، ما يتطلب تحديثات معدومة لمشفر الرؤية، وتضيف حد أدنى من التكلفة التشغيلية.

عند دمج TGIF في نموذج LLaVA-1.5-7B، يُظهر انطباعًا ثابتًا بتحسن الأداء عبر مجموعة من مجالات الهلوسة و OCR و VQA، بينما يتم الحفاظ على الأداء أو تحسينه في مهام ScienceQA و GQA و MMBench. هذه النتائج تشير إلى أن الدمج المعتمد على الاستعلام، وبوعي التسلسل، هو وسيلة فعّالة لتعزيز التثبيت البصري وتقليل الهلوسة في MLLMs الحديثة.