في تطور مثير للذكاء الاصطناعي، تكشف الأبحاث الجديدة حول التعلم المعزز مع مكافآت قابلة للتحقق (Reinforcement Learning with Verifiable Rewards - RLVR) عن إمكانية تحسين قدرات التفكير في نماذج اللغة متعددة الأنماط (Multimodal Large Language Models - MLLMs). بينما تعتمد النماذج الحالية على إشارات مكافأة粗ة ومستويات تسلسلية، فإن الدراسة الحالية تسلط الضوء على الفجوة المعرفية في المشروعات التي تعتمد على خطوات مرئية دقيقة ضمن سلسلة التفكير متعدد الأنماط.
تتمحور الأبحاث حول مفهومين رئيسيين، وهما الاعتماد البصري (Visual Dependency) - والذي يحدد مدى اعتماد التنبؤات على ميزات الصورة المدخلة - وإنتروبيا التنبؤ (Predictive Entropy). تظهر تحليل البيانات أن سلاسل التفكير الصحيحة تميزت بانخفاض حاد في الإنتروبيا مع زيادة الاعتماد البصري، مقارنة بالنتائج الخاطئة.
علاوة على ذلك، هناك توكنات حيوية (Pivotal Tokens) تؤدي الأخطاء فيها إلى انهيار سلسلة التفكير، وتظهر كقيم شاذة في التوزيع المشترك للاعتماد البصري والإنتروبيا. بناءً على هذه النتائج، تم اقتراح تقدير المزايا المرتكز على تصور التوكنات (Token-Level Perception-Grounded Advantage Estimation - TPAE)؛ حيث يقيم هذا النظام مزايا كل توكن من خلال قياس اتساقه الإحصائي مع أنماط الرؤية والإنتروبيا من السلاسل الصحيحة.
تجريبيًا، تظهر النتائج أن TPAE يتفوق بشكل مستمر على الأسس القوية الرائدة، مما يحقق تحسينًا أكثر استقرارًا وكفاءة في عمليات التعليم متعدد الأنماط. للاطلاع على الكود الخاص بهذا الابتكار، يمكن زيارة الرابط التالي: رابط الكود.
تحسين التفكير متعدد الأنماط من خلال تقدير المزايا المرتكزة على تصور التوكنات
تكشف دراسات جديدة عن كيفية تحسين التعلم المعزز من خلال استخدام التقييم الدقيق للمزايا على مستوى التوكنات. هذه الاستراتيجية تعزز من دقة نماذج اللغة متعددة الأنماط وتمهد الطريق لتحسين تقنيات التعليم الآلي.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
