تظل مشكلة الهلوسة تحديًا بارزًا في نماذج الرؤية واللغة الكبيرة (LVLMs)، حيث تساهم معظم الطرق الحالية في الحد منها من خلال تقنيات مثل التصور التعزيزي أو تعزيز المكونات البصرية أثناء عملية التوليد. ولكن، يبقى السؤال الأهم: هل يمكن لهذه النماذج تنظيم مساهمات مصادر السياق المختلفة بشكل ديناميكي للحد من الهلوسة؟
في دراسة جديدة، استقصى الباحثون كيف تنسق نماذج LVLMs بين مصادر السياق المتعددة خلال عملية التوليد، كما قاموا بتقييم كيف يمكن للسلوك الداخلي لهذه النماذج أن يساهم في تخفيف الهلوسة. وقد أظهرت النتائج أن هذه النماذج تمتلك ميلًا داخليًا لحضور الصورة، مما يساعد على توجيه بصري تفاعلي، بينما تساهم السياقات النصية أيضًا في تقليل الهلوسة.
واستنادًا إلى هذه النتائج، اقترح الباحثون نموذج AIMS (توجيه المعلومات المتعددة المصدر المتكيف)، وهو إطار عمل خفيف لا يتطلب تدريبًا إضافيًا. يقوم هذا الإطار بتنظيم السياقات البصرية والنصية بشكل ديناميكي أثناء عملية التوليد.
يستخدم AIMS نماذج أولية مدمجة لمجالات السياق الثلاثة لتقدير تقاربها مع الاستفسار الحالي، مما يحدد أوزان التوجيه لكل رأس. تُطبق الاتجاهات الناتجة للتوجيه متعدد المصادر على تمثيل الاستفسار، مما يمكّن من دمج السياقات بشكل تكيفي دون الحاجة لتدريب إضافي أو عمليات إضافية.
أظهرت التجارب الواسعة عبر مجموعة من نماذج LVLMs واستراتيجيات التوليد أن نموذج AIMS يمكنه بشكل فعال تخفيف الهلوسة المرتبطة بالأشياء، مع المحافظة على قدرات متعددة الأغراض تنافسية على المستوى العام. إن هذه النتائج تمثل خطوة متقدمة نحو تحسين أداء نماذج الرؤية واللغة بشكل عام ودون الحاجة إلى تعقيد التدريب الإضافي.
مستقبل تخفيف الهلوسة في نماذج الرؤية واللغة: اكتشاف نمط توجيه متعدد السياقات
تواجه نماذج الرؤية واللغة الكبيرة (LVLMs) تحديات كبيرة في موضوع الهلوسة، لكن دراسة جديدة تقدم إطار العمل AIMS الذي يتيح تكامل سياقات متعددة بذكاء. هذا الإطار يوفر حلاً مبتكرًا لتخفيف الهلوسة دون الحاجة إلى تدريب إضافي.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
