تحظى نماذج اللغات الكبيرة متعددة الوسائط (MLLMs) بسمعة كبيرة في المساهمة في تقديم تقنيات ذكاء اصطناعي متقدمة، لكنها في الوقت نفسه تواجه تحديات خطيرة تُعرف بالهلاوس الذهنية. هذه الهلاوس تُعد واحدة من أكبر العقبات التي تعطل موثوقية هذه النماذج في تطبيقات حيوية.

رغم أن التقييمات الحالية تركز على معايير ثابتة، إلا أنها تفتقر إلى تغطية شاملة وأنماط تقييم فعّالة تعكس أداء النموذج في السيناريوهات الحقيقية. ولتجاوز هذه الفجوة، تم تقديم إطار تقييم شامل يدمج بين مجموعة تقييمات متكاملة واختبارات ضغط ذاتية التطور.

نظام UniHall هو توفر مُعِدّل ذا دقة عالية يعتمد على تصنيف موحد يشتمل على أبعاد كائن، وتعليمات، ومعرفة. هذا النظام يقدم نهجاً ذكياً للتعامل مع التحديات الموجودة ويسمح بمزيد من الفهم الدقيق وقدرة أكبر على المناورة.

للحد من ظاهرة التشبث بالأداء في معايير التقييم، تم اقتراح إطار Self-Adaptive Multimodal Fuzzing (SAMF). هذا النظام يعتمد على استراتيجيات التطور لاستكشاف حدود الهلاوس الذهنية للنموذج، وبالتالي يساهم في تحسين القياس والدقة في تقييم المدخلات الديناميكية.

تظهر النتائج التجريبية أن النماذج الحديثة MLLM تخضع لتدهور كبير في الأداء خلال مراحل الفوضى مقارنة بالإعدادات التقليدية، مما يكشف عن وجود انفصال بين قدرات التفكير والجذور الواقعية للمعلومات. كما تم تحديد توازن بين مساعدة الهلاوس، حيث يؤدي توافق التعلم المعزز أحياناً إلى تفاقم عمليات الاستجابة للمدرسة في المهام الموجهة.

لهذا السبب، يعد هذا الإطار الجديد مع مجموعة بياناته وكوداته المتاحة بمثابة خطوة كبيرة نحو تحسين موثوقية الذكاء الاصطناعي. لمزيد من التفاصيل، يمكن زيارة الرابط: GitHub - EvalHall.