في عالم الذكاء الاصطناعي، تظهر نماذج اللغة البصرية الكبيرة (Large Vision-Language Models - LVLMs) كأحد الابتكارات الرائدة التي تربط بين فهم الصور وتوليد النصوص. لكنها ليست خالية من التحديات، فهذه النماذج قد تعاني من مشكلة "الهلوسة" عند التعامل مع الاستجابات، حيث قد تمدّ خارطة الكلمات بالنصوص التي لا تتوافق مع ما تقدمه الصور.

وعلى الرغم من ابتكار مقاييس الثقة، إلا أن الفحوصات أظهرت أنها ليست كافية لتقييم استجابات LVLMs بدقة. إذ أن سحب الصورة المدخلة لا يؤثر بشكل ملحوظ على اختيارات الثقة، مما يعني أن هذه المعايير تقيّم عادةً القابلية للنصوص بدلاً من توافقها مع الصورة.

لذا، جاء الابتكار الجديد المعروف باسم "LookBack"، الذي لا يحتاج إلى تدريب إضافي، ليعالج هذه الفجوة من خلال تقديم طريقة جديدة لتقييم استجابات LVLMs. تعتمد هذه الطريقة على تحسين احتماليات الرموز النصية باستخدام مقياس "نظرة العودة البصرية" الذي يقيس قوة الإشارة بين كل رمز استجابة ورموز الصورة.

لقد أظهرت التجارب على أربعة معايير وثلاثة نماذج أن نتائج LookBack باستمرار تحسّن من اختيارات "أفضل من N" مقارنةً بأسس تقييمية موجودة مسبقًا مع زيادة طفيفة جدًا في تكلفة المعالجة.

تعتبر هذه النقطة تحولًا مهمًا في كيفية فهمنا وتقييمنا لنتائج نماذج اللغة البصرية، مما يقدم آفاقًا جديدة للاستخدامات المستقبلية في مجالات متعددة. هل تعتقد أن LookBack ستكون أساسية في تطوير نماذج الذكاء الاصطناعي؟ لا تتردد في مشاركتنا آراءك في التعليقات!