في عالم الذكاء الاصطناعي، تمثل نماذج اللغة متعددة الوسائط (Multimodal Large Language Models - MLLMs) خطوة ثورية، ولكنها تواجه تحديًا كبيرًا يتمثل في "الهلاوس" التي يمكن أن تؤثر على دقتها وموثوقيتها. وقد أظهرت الأبحاث أن هناك حاجة ماسة إلى تطوير أساليب لتقييم عدم اليقين (Uncertainty Quantification - UQ) لضمان نشر هذه النماذج بطريقة موثوقة.
تكشف الدراسة الجديدة عن مشكلة خطيرة كانت قائمة في طريقة التعامل مع عدم اليقين، خاصةً عندما تكون الإشارات ذات الصلة بالاستفسار ضعيفة. يبدو أن معظم الأساليب القائمة تركز على عدم اليقين العشوائي الناجم عن غموض البيانات، متجاهلة بذلك عدم اليقين المعرفي الناتج عن قيود النموذج نفسه.
لتجاوز هذه التحديات، قدم فريق البحث "التظليل الثابت الملائم" (Causal-Invariant Masking - CIM) كأداة تقيس التغير الدلالي بين التنبؤات الأصلية وتلك التي تعتمد على وجهة نظر مركزية سببية. ومن خلال هذا الإطار، تم تقديم قياس "انحراف المعاني" (Semantic Divergence) كأساس لقياس عدم اليقين، حيث أشارت الأدلة النظرية إلى قدرته على التقاط القيود التي تعاني منها نماذج MLLM.
لزيادة كفاءة تقييم عدم اليقين، اقترح الفريق أيضًا استخدام "معدل انزياح المعاني المتوقع" (Expected Embedding Drift - EED)، وهو مقياس هندسي سريع يقدر التغير الدلالي مباشرة داخل فضاء الانغماس الكروي، حيث أظهرت الاختبارات أن هذه التقنية تحقق أداءً متفوقاً في مختلف المؤشرات، مع تسريع الأداء بنسبة تقارب 50% مع الحفاظ على نتائج قوية.
لا شك أن هذه الابتكارات تمثل تقدمًا كبيرًا في مجال تقييم موثوقية النماذج اللغوية، ما يبشر بعصور جديدة من القدرة على الاعتماد عليها في تطبيقات الذكاء الاصطناعي.
ما رأيكم في هذه التطورات؟ هل تعتقدون أنها ستغير معايير الاعتماد على التقنيات؟ شاركونا في التعليقات!
كشف عدم اليقين المعرفي في نماذج اللغة متعددة الوسائط: ثورة جديدة في تقييم الثقة!
تقدم دراسة جديدة مفهوم عدم اليقين المعرفي في نماذج اللغة متعددة الوسائط وتعرض طريقة مبتكرة لتحديد حجم هذا عدم اليقين. استخدام تقنيتي التظليل الثابت الملائم ومعدل انزياح المعاني يعد نقلة نوعية في التأكد من موثوقية هذه النماذج.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
