في عالم النماذج اللغوية متعددة الوسائط (Multimodal Large Language Models - MLLMs)، تعتمد العمليات التقليدية غالبًا على ميزة واحدة متأخرة من مشفر الرؤية (Vision Encoder) المجمد، مما يجعلنا نشهد تفويتاً للعديد من الإشارات البصرية الغنية التي يوفرها هذا الطبق. وللأسف، لا تزال هذه النماذج تعاني من ظاهرة الهلوسة غير المدعومة بصريًا، حيث تعتمد في الكثير من الأوقات على أولويات اللغة بدلاً من الأدلة البصرية.
فيما تركزت العديد من استراتيجيات التخفيف السابقة على الجانب النصي ودون تغيير التمثيل البصري، لم تستغل هذه الاستراتيجيات التسلسل الغني للميزات المرمّزة عبر طبقات الرؤية. في هذا السياق، تظهر تقنيات الدمج متعددة الطبقات المحدودة، لكن تفشل في تقديم تطورات ديناميكية، حيث تطبق نفس مزيج الطبقات بغض النظر عن الاستعلام.
لذا، نُقدم تقنية TGIF (Text-Guided Inter-layer Fusion) كحلاً خفيف الوزن يعامل طبقات المشفر كـ "خبراء" عمق، ويتنبأ بدمج ميزات بصرية تعتمد على كل استعلام. TGIF تعكس مبدأ الدمج الخارجي المباشر، ما يتطلب تحديثات معدومة لمشفر الرؤية، وتضيف حد أدنى من التكلفة التشغيلية.
عند دمج TGIF في نموذج LLaVA-1.5-7B، يُظهر انطباعًا ثابتًا بتحسن الأداء عبر مجموعة من مجالات الهلوسة و OCR و VQA، بينما يتم الحفاظ على الأداء أو تحسينه في مهام ScienceQA و GQA و MMBench. هذه النتائج تشير إلى أن الدمج المعتمد على الاستعلام، وبوعي التسلسل، هو وسيلة فعّالة لتعزيز التثبيت البصري وتقليل الهلوسة في MLLMs الحديثة.
TGIF: تقنية جديدة لتعزيز دقة النماذج اللغوية متعددة الوسائط وتقليص الهلوسة!
تقدم تقنية TGIF حلاً مبتكرًا لتقليل الهلوسة في نماذج اللغات متعددة الوسائط من خلال دمج الطبقات بمساعدة النصوص. هذه التقنية تُظهر تحسنًا ملحوظًا في الأداء على مجموعة متنوعة من المهام.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
