تواجه نماذج اللغة متعددة الأنماط (MLLMs) تحديات كبيرة فيما يتعلق بالهلوسات، وهو ما يؤثر على موثوقيتها بشكل عام. بينما تركز المعايير الحالية على هلاوس الكيانات والسمات والعلاقات، إلا أن إخفاقات المعرفة غالباً ما يتم فحصها بشكل منفصل، مما يخلق فجوة في تقييم موحد عبر جميع أبعاد الهلاوس.
للتغلب على هذه المشكلة، تم تصميم معيار "KnowHal"، والذي يعزز من تقييم الهلاوس المتعددة الأبعاد عبر دمج هلاوس المعرفة. يشمل هذا المعيار أربعة أبعاد رئيسية: الكيانات، السمات، العلاقات، والمعرفة. من خلال إنشاء أسئلة مزدوجة إيجابية وسلبية حول الصور والكيانات المشتركة، يمكن لهذا المعيار تقديم مقارنات دقيقة بين الأخطاء الإدراكية وأخطاء المعرفة وقبول الافتراضية الخاطئة.
يحتوي معيار KnowHal على 1800 عينة موزعة على 10 مجالات و50 فئة، تم تطويرها من خلال عملية شبه آلية تجمع بين مساعدة نماذج اللغة الكبيرة (LLM) وتصفية CLIP والتحقق البشري. لقد تم تقييم 14 من نماذج MLLMs الممثلة باستخدام KnowHal، حيث أظهرت النتائج أن بعد المعرفة يعد الأكثر تحديًا لمعظم النماذج التي تم تقييمها. كما كشفت معظم النماذج عن تدهور كبير في الأداء عند التعامل مع الأسئلة السلبية، مما يكشف النقاط الضعيفة في التعاطي مع الافتراضات الخاطئة.
من خلال توحيد أبعاد الهلاوس الأربعة مع تصميم أسئلة مزدوجة، يملأ KnowHal فجوة مهمة في الأطر التقييمية الحالية، مما يمكّن من تقييم أكثر شمولية للهلاوس في MLLMs.
اكتشف KnowHal: معيار ثوري لتقييم الهلوسة المتعددة الأبعاد في نماذج الذكاء الاصطناعي!
تمثل KnowHal معيارًا جديدًا يركز على تقييم الهلوسة المتعلقة بالمعرفة في نماذج اللغة متعددة الأنماط (MLLMs). يسعى هذا الابتكار إلى تحسين موثوقية هذه النماذج من خلال تقييم شامل لأبعاد متعددة للهلاوس.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
