في عالم الذكاء الاصطناعي، تُعتبر مشاكل الهلوسة أحد أكبر التحديات التي تواجه نماذج اللغة الكبرى متعددة الوسائط (MLLMs). ورغم أن التعلم التعزيزي (Reinforcement Learning) يُستخدم بشكل واسع لتعزيز قدرات الاستدلال، إلا أن تأثيره على الهلوسة لا يزال غير متساوٍ. في هذا السياق، تم الكشف عن نقاط ضعف في سلسلة التصحيح التي تربط بين المكافأة وتحديث المعاملات.
تظهر الدراسات أن الاستفسارات الصعبة، التي تتميز باحتمالية دلالية عالية، تضرب بنماذج رديئة تنتج مجموعات خاطئة بشكل جماعي، مما يعرضها لمخاطر الهلوسة بأعلى مستوياتها. وفوق ذلك، فإن الرموز الواثقة ولكن الخاطئة لا تتلقى تحديثات قوية، مما يعزز من نشاط الهلوسة.
هذه التحديات دفعت الباحثين لتقديم مفهوم جديد يُدعى تحسين السياسة المزدوجة المعززة بالـ "DEEPO"، الذي يتضمن تحسينات مزدوجة تجمع بين تنظيم تباين الإشارات والتحضير للتحليل. تهدف هذه التقنية إلى حقن استمراريات معتمدة على التخصص في حالات الشك العالي، مما يسهم في تحسين عملية التعلم وتقليل الهلوسة.
تظهر النتائج الأولية أن DEEPO لم ينجح فقط في تقليل الهلوسة، بل حافظ أيضًا على دقة النموذج واستقرار التدريب. على سبيل المثال، تم تسجيل تحسن ملحوظ في أداء نماذج VideoMMMU، حيث حقق تحسينًا يصل إلى +4.0.
إن هذا الابتكار يمثل خطوة مهمة نحو تعزيز الفعالية في نماذج MLLMs، مما يعكس إمكانية كبيرة لتحسين تجارب المستخدمين وتقليل الأخطاء أثناء التفاعل.
تحسين السياسة المزدوجة لتحسين مواجهة الهلوسة في نماذج اللغة الكبرى
تم تقديم DEEPO، وهي تقنية جديدة لتحسين السياسة التي تعالج مشكلة الهلوسة في نماذج اللغة الكبيرة متعددة الوسائط. تسمح هذه التقنية بتحسين التعلم وتقليل الأخطاء مع الحفاظ على الاستقرار في التدريب.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
