في عالم الذكاء الاصطناعي، تمثل نماذج اللغات السمعية البصرية (Audio-Visual Large Language Models) تقدماً مذهلاً، لكن لا يزال هناك تحديات كبيرة تواجهها. الأوهام السمعية البصرية، حيث تؤثر معلومات من نمط واحد على التنبؤات في نمط آخر بشكل خاطئ، تشكل أحد هذه التحديات.

تعتبر عمليات فك التشفير التقليدية غير كافية لمواجهة هذه الظاهرة، حيث يتطلب كل سؤال أدلة حسية مختلفة، سواء من الصوت أو الفيديو أو تفاعل كليهما. على سبيل المثال، قد يتمكن نموذج وحده من التعرف على آلة الكمان من الصوت، ولكن عندما يتم إضافة فيديو يُظهر الغيتار، قد تقل ثقة النموذج في التنبؤ بدقة.

لحل هذه المشكلة، تم تقديم تقنية جديدة تعرف بفك تشفير الأدلة ذات الصلة (Relevant Evidence Decoding RED)، والتي تعتمد على طريقة تدريب مجانية. تقوم هذه الطريقة بتحديد الأدلة الهامة للأسئلة وتعزيز مساهمتها بشكل انتقائي.

تعمل RED من خلال قياس الدعم التنبؤي من الصوت والفيديو مع الأخذ بعين الاعتبار المتطلبات المحددة للسؤال المطروح. باستخدام معلومات الالتقاء المتبادل النقطية (Pointwise Mutual Information)، تفكك RED المساهمة المشتركة بين الصوت والفيديو إلى مكونات فردية، مما يعزز دقة النموذج.

تظهر التجارب على ثلاثة معايير للأوهام السمعية البصرية وأسئلة بشأن نماذج AV-LLMs، أن RED تحسن دقة التنبؤات بشكل ملحوظ، حيث بلغت الزيادة 7% في CMM، و6.3% في AVHBench، و3.8% في SVHalluc.

بهذه الطريقة، تخطو تقنيات الذكاء الاصطناعي خطوة مهمة نحو تحسين كيفية تعامل النماذج مع المعلومات المتنوعة، مما يفتح مجالات جديدة للتطبيقات المستقبلية.