في عالم التعلم الآلي، لا تزال نماذج اللغة البصرية (Vision-Language Models) تتطور باستمرار بهدف تحسين دقة التعليقات على الصور. ومع ذلك، كانت هناك حاجة ملحة لتحسين الطريقة التي تُكتب بها التعليقات، حيث يجب أن تكون دقيقة وشاملة، مع تجنب الإشارة إلى كائنات غير موجودة.

لتلبية هذه الحاجة، قدم فريق من الباحثين إطارًا ثوريًا جديدًا يسمى PatchGate. يعتمد هذا النظام على تقنية فريدة تهدف إلى تقليل الفجوة بين الكائنات الظاهرة في الصورة والكائنات التي يذكرها النموذج.

تتيح طريقة PatchGate استخراج الأدلة البصرية المدمجة من نموذج اللغة البصرية المجمد قبل بدء عملية التوليد، مما يساعد على تحسين النتائج بشكل كبير. تتكون العملية من مرحلتين رئيسيتين:

1. **استخراج الأدلة البصرية (Visual Evidence eXtraction - VEX)**: يقوم هذا الجزء بقراءة الأدلة الكلمة على مستوى المقطع من طبقات تفكيك النموذج، وذلك لبناء مجموعة من الكائنات استنادًا إلى الصورة دون الحاجة إلى تلميحات إضافية.

2. **تضمين واستبعاد الأدلة البصرية (Visual-Evidence Inclusion-Exclusion Decoding - VIED)**: في هذه المرحلة، يُستخدم الدليل المستخرج لتعديل تقديرات النموذج، مما يعزز الاعتراف بالكائنات التي تحتاج إلى مزيد من الكتابة ويقيد الكائنات التي ذُكرت بشكل مفرط دون دعم.

أظهرت التجارب على مجموعة بيانات AMBER أن PatchGate تحقق تحسينات ملحوظة، حيث زادت نسبة التغطية للكائنات المرئية من 49.4% إلى 56.0%، أي بزيادة 13.4%، كما انخفضت ظاهرة التخييل (object hallucination) من 7.5 إلى 6.6، مما يعكس تقليصًا بنسبة 12% في الأخطاء.

ما يجعله مميزًا هو أنه لا يتطلب أجهزة إضافية أو مراحل تدريب جديدة، بل يعتمد فقط على تمريرة إضافية واحدة.

تعد هذه النتائج واعدة للغاية وتفتح آفاق جديدة في مجال الذكاء الاصطناعي وتطبيقاته العملية. كيف يبدو لك هذا الابتكار؟ هل تعتقد أن بإمكانه تغيير فكرة كتابة التعليقات على الصور بشكل جذري؟ شاركونا آراءكم في التعليقات!