في عالم الذكاء الاصطناعي، يعد تحسين التفكير المتعدد الأنماط (Multimodal Reasoning) مسعى حاسماً لتطوير نماذج ذكاء اصطناعي أكثر فعالية. وفي هذا السياق، تم تقديم إطار StructReward كحل مبتكر يعتمد على التعلم المعزز مع مكافآت قابلة للتحقق (Reinforcement Learning with Verifiable Rewards - RLVR).
تحقيقاً لهذه الغاية، تسلط StructReward الضوء على ضعف الأساليب التقليدية التي تعتمد على مكافآت ثنائية تقيّم الإجابات النهائية فقط، مما يتجاهل قيمة خطوات التفكير المتوسطة. بينما تقدم نماذج مكافآت العمليات توجيهاً مفصلاً، إلا أن اعتمادها غالبًا على مدققين مدربين بشكل منفصل أو علامات معقدة يتطلب جهودًا كبيرة.
لقد ابتكرنا في StructReward نموذجًا فعالًا من الناحية الحسابية يجمع بين مكافآت هيكلية دقيقة وخطوات التفكير، مما يعزز القدرة على توفير إشارات مكافأة كثيفة. من خلال تمثيل كل حل تم إنشاؤه كسلسلة من خطوات التفكير، نقوم بمحاذاة هذه الخطوات مع خطوات مرجعية معلمة بشكل هيكلي باستخدام قواعد مطابقة رقمية ورمزية ولغوية بسيطة.
تجمع العلامات المحاذاة في مكافأة عملية كثيفة، والتي يتم دمجها لاحقًا مع مكافآت متسقة للإجابات النهائية وصلاحية المخرجات من خلال هدف تحسين السياسات النسبية (Group Relative Policy Optimization - GRPO).
علاوة على ذلك، نعيد استخدام مسارات السياسات لمقارنة الاستجابات والتصحيح الذاتي العاكس، بدلاً من التخلص منها بعد تحديث السياسات. باستخدام نموذج لغة قوي، نقوم بإعادة كتابة المسارات الصحيحة التي تم أخذ عينات منها إلى حالات تدريب موجهة نحو الانعكاس، مما يعزز قدرة السياسة على تقييم وتنقيح تفكيرها.
بفضل تقليل العبء الحسابي بشكل كبير من خلال تنفيذ مكافآت العمليات على الإنترنت دون الحاجة إلى مدقق خارجي إضافي، أثبتت نتائج التجارب أن الإشراف الهيكلي وإعادة تدوير المسارات تقدم مسارًا فعالًا نحو تعزيز التفكير المتعدد الأنماط الذاتي التحسين.
إنطلاق StructReward: إطار ثوري لتحسين التفكير المتعدد الأنماط عبر مكافآت هيكلية فعالة!
تقدم StructReward نموذجاً مبتكراً في تعلم التعزيز، يوفر إشارات مكافأة هيكلية دقيقة تعزز القدرة على التفكير المتعدد الأنماط. هذه التقنية تمثل نقلة نوعية في طرق تحسين الذكاء الاصطناعي!
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
