تواجه نماذج اللغة متعددة الأنماط (MLLMs) تحديات كبيرة فيما يتعلق بالهلوسات، وهو ما يؤثر على موثوقيتها بشكل عام. بينما تركز المعايير الحالية على هلاوس الكيانات والسمات والعلاقات، إلا أن إخفاقات المعرفة غالباً ما يتم فحصها بشكل منفصل، مما يخلق فجوة في تقييم موحد عبر جميع أبعاد الهلاوس.

للتغلب على هذه المشكلة، تم تصميم معيار "KnowHal"، والذي يعزز من تقييم الهلاوس المتعددة الأبعاد عبر دمج هلاوس المعرفة. يشمل هذا المعيار أربعة أبعاد رئيسية: الكيانات، السمات، العلاقات، والمعرفة. من خلال إنشاء أسئلة مزدوجة إيجابية وسلبية حول الصور والكيانات المشتركة، يمكن لهذا المعيار تقديم مقارنات دقيقة بين الأخطاء الإدراكية وأخطاء المعرفة وقبول الافتراضية الخاطئة.

يحتوي معيار KnowHal على 1800 عينة موزعة على 10 مجالات و50 فئة، تم تطويرها من خلال عملية شبه آلية تجمع بين مساعدة نماذج اللغة الكبيرة (LLM) وتصفية CLIP والتحقق البشري. لقد تم تقييم 14 من نماذج MLLMs الممثلة باستخدام KnowHal، حيث أظهرت النتائج أن بعد المعرفة يعد الأكثر تحديًا لمعظم النماذج التي تم تقييمها. كما كشفت معظم النماذج عن تدهور كبير في الأداء عند التعامل مع الأسئلة السلبية، مما يكشف النقاط الضعيفة في التعاطي مع الافتراضات الخاطئة.

من خلال توحيد أبعاد الهلاوس الأربعة مع تصميم أسئلة مزدوجة، يملأ KnowHal فجوة مهمة في الأطر التقييمية الحالية، مما يمكّن من تقييم أكثر شمولية للهلاوس في MLLMs.