في عالم الذكاء الاصطناعي، تتقدم الأبحاث بشكل مستمر لتقديم حلولٍ مبتكرة لم تحدد فقط مستوى الذكاء الاصطناعي، بل أيضًا تعزز من فعاليته في معالجة البيانات المرئية. وأحد أبرز هذه الابتكارات هو نظام "Look Twice" (LoT) الذي تم تطويره لتحسين أداء نماذج الذكاء الاصطناعي في مجال الإجابة على الأسئلة البصرية المعتمدة على المعرفة (Knowledge-based Visual Question Answering | KB-VQA).

يواجه النشاط المعتمد على المعرفة تحديات كبيرة حيث تتطلب الأنظمة الموجودة حاليًا تحليلاً معقدًا للمعطيات المرئية والنصية. ولكن عملية استرجاع المعلومات غالبًا ما تضيف محتوىً مختل أو غير ذي صلة، مما يجعل نماذج اللغة المتعددة الوسائط (Multimodal Large Language Models | MLLMs) تفقد دلائل قوية تدعم الإجابات الصحيحة.

للتغلب على هذه التحديات، يقدم LoT آلية انتقاء أدلة متعددة الوسائط من خلال استغلال أنماط الانتباه الداخلي للنموذج بشكلٍ مباشر. تعتمد هذه الطريقة على تحديد مناطق الصور والنصوص ذات الصلة بالسؤال، مع تصفية المحتوى المزعج، مما يسهل تعزيز الأدلة المختارة قبل توليد الإجابة.

ما يُميز LoT هو عدم الحاجة لتحديث المعلمات أو استخدام نماذج إضافية أو تعديلات معمارية. وقد أظهرت الاختبارات على أربع معايير KB-VQA وعشرة نماذج MLLMs جاهزة ما بين 2 إلى 38 مليار معلمة، أن LoT ساهم في تحسين الدقة بمعدل يزيد عن 12.5 نقطة.

تقدم هذه النتائج دليلاً على أن Look Twice هو آلية فعالة وشاملة تتيح لنماذج MLLMs المدربة مسبقاً استغلال الأدلة المتعددة الوسائط بشكل أكثر دقة، مما يفتح آفاقًا جديدة في هذا المجال.

يمكنك الاطلاع على الكود المصدري لهذه الأداة المتطورة عبر هذا الرابط: [https://aimagelab.github.io/LoT/].