تُظهر نماذج اللغة والرؤية المشتركة (Large Vision-Language Models - LVLMs) قدرات قوية في التفكير المتعدد النماذج، ولكنها لا تزال عرضة لما يُعرف بالهلوسة، حيث تكون التنبؤات غير مترابطة بالأدلة البصرية. في السابق، كانت الطرق التقليدية للكشف عن الهلوسة تعتمد على قياس واحد يُعرف بمقياس التوافق، لكن هذه الطرق لم تكن كافية للتعبير عن أنظمة الهلوسة المتنوعة التي يمكن أن تظهر عبر نماذج مختلفة.
نقدم لكم إطار عمل مبتكر يسمى "كشف أنماط الهلوسة الفريدة (Unique Hallucination Pattern - UHP)"، الذي يمثل الهلوسة كنمط هيكلي من عدم اليقين مُحدد من خلال محورين رئيسيين: نمط الاضطراب (صورة مقابل نص) والقطبية المنطقية (تصريح ضد نفيه). تقاطع هذين المحورين يشكل أربع مجموعات تكاملية من التوافق، مما يتيح لنا استخراج ميزات فريدة من الداخل، للوصول إلى مصنف خفيف الوزن.
عبر مجموعة شاملة من التجارب على منصتي AMBER و PhD، أظهر نظام UHP أداءً متفوقًا باستمرار على الأساليب التقليدية الدارجة، مع تحسينات تصل إلى 18.72% في AUC-ROC و20.07% في AUC-PR مقارنةً بأقوى الطرق السابقة. كما أظهرت الدراسات الشاملة أن كل مجموعة توافق تسهم بمعلومات تكاملية تؤدي إلى تشكيل نمط هيكلي مختلف للهلاوس.
بالإضافة إلى ذلك، أثبتت التقييمات عبر مجموعات بيانات متعددة أن هذا النمط المكتسب يمكن أن يُعمّم عبر المراجع المختلفة، مما يدل على أن سلوك الهلوسة يعكس نمط توافق محدد لكل نموذج. الكود متاح للجمهور على رابط GitHub.
اختصارًا، يمثل كشف أنماط الهلوسة الفريدة خطوة كبيرة نحو تحسين دقة وموثوقية النماذج متعددة النماذج. ما رأيكم في هذا التطور؟ شاركونا في التعليقات!
دليلك الشامل لفهم أنماط الهلوسة الفريدة في نماذج اللغة والرؤية المشتركة!
اكتشف كيف يتم الكشف عن أنماط الهلوسة الفريدة في نماذج اللغة والرؤية المشتركة (LVLMs)، من خلال إطار Black-box ثوري يعزز دقة التنبؤات. هل أنت مستعد لفهم هذا التطور الجديد؟
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
