تعتبر نماذج الرؤية-لغة الكبيرة (Large Vision-Language Models) من أبرز الابتكارات في عالم الذكاء الاصطناعي، ولكنها تعاني من مشكلة الهلوسة، حيث تصف أشياء وأحداث غير موجودة في الصور. في دراسة حديثة، اكتشف الباحثون أن جزءًا من فشل هذه النماذج مرتبط بعدم استقرار الميزات، إذ تؤدي التغييرات الطفيفة في المدخلات إلى تشويش كبير في التمثيلات المتعلمة.

وفي مواجهة هذه المشكلة، طور الفريق البحثي نموذجًا جديدًا يسمى INFUSE الذي يقدم نهج استقرار ضمني. وعلى عكس الحلول السابقة التي كانت تتطلب تدخلًا صريحًا أثناء فترة التنفيذ، يقوم INFUSE بإدخال استقرار ميزات الصور والنصوص أثناء عملية التدريب، مما يعني أن النموذج لا يحتاج إلى أي عمليات إضافية عند التشغيل.

تعتمد طريقة INFUSE على تثبيت التمثيلات حول نقاط مرجعية متوسطة وأكيدة، مما يسمح بربط التمثيلات المستقرة عبر النماذج المختلفة باستخدام أهداف مقارنة ثنائية الاتجاه. أظهرت النتائج أن النموذج قد خفّض معدل الهلوسة AMBER CHAIR بنسبة تتراوح بين 46% إلى 63% مقارنة بالنماذج الأساسية، كما حسن من قياسات الهلوسة الأخرى مع الحفاظ على دقة الاستجابة.

إن نموذج INFUSE يمثل خطوة متقدمة في تعزيز استقرار الأداء للنماذج الكبرى، مما يبشر بمستقبل أكثر دقة وثقة في الذكاء الاصطناعي. فما رأيكم في هذه الابتكارات؟ هل تعتقدون أن بإمكانها تغيير طريقة تعاملنا مع المحتوى البصري والنصوص؟ شاركونا آراءكم في التعليقات.