تشهد نماذج اللغة المتطورة (Diffusion Large Language Models - dLLMs) تقدمًا مذهلاً في قدرتها على توليد نصوص متقنة من خلال تقنية إزالة الضوضاء، مما يسمح بالكشف عن عدة رموز في وقت واحد. ومع تقدم الذكاء الاصطناعي، تم إدخال مفهوم التعلم التعزيزي مع المكافآت القابلة للتحقق (Reinforcement Learning with Verifiable Rewards - RLVR) الذي يعيد استخدام التعليقات النهائية عبر قرارات متعددة بينما يتغير السياق.
في هذا السياق، تم اقتراح تقنية جديدة تُسمى GRPO الحساسة للمخاطر التقدمية (Stepwise Risk-Sensitive GRPO) التي تعدل معامل المخاطر في تحويل ميزة المجموعة عبر حالات إزالة الضوضاء، مع الاحتفاظ بالمدرب الأساسي. ومن خلال مكافآت ثنائية، يُظهر هذا التحويل أنه يمثل بالتحديد تعديلًا يعتمد على السياق والنتيجة.
تقدم عملية المعايرة القائمة على القدرات مقاييس لمعامل المخاطر، كما تتيح دراسات الإزالة، اختيار الجداول المناسبة. وبينما تم اختبار هذه التقنية عبر عدة نماذج dLLM ومعايير التفكير الرياضي، أظهرت النتائج تحسنًا ملحوظًا في الدقة (pass@1) ونسبة التغطية (pass@k) مقارنةً بالتقنيات السابقة، مع زيادة في تنوع الإجابات. تُظهر دراسات الإزالة أيضًا أن هذه المكاسب تتجاوز السلاسل النهائية للإجابات، مما يُعزز تأثير هذه التقنية في مجالات الذكاء الاصطناعي المتقدمة.
استكشاف أعمق، تفكير أفضل: تقنية GRPO الحساسة للمخاطر في نماذج اللغة المتطورة
في خطوة مبتكرة في مجال نماذج اللغة المتطورة، تم تقديم تقنية GRPO الحساسة للمخاطر التي تعزز دقة الإجابات وتنوعها. تُحدث هذه التقنية تحسينات ملحوظة في الأداء عبر مجموعة من التحديات الرياضية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
