في عالم الذكاء الاصطناعي، يُعَد التعلم المعزز (Reinforcement Learning) أسلوبًا متقدمًا يمكّن الوكالات المدعومة بنماذج لغوية كبيرة (Large Language Models) من حل المهام المعقدة. ومع ذلك، كانت التحديات قائمة في كيفية الاستفادة من أنماط الاستكشاف القابلة لإعادة الاستخدام بعد كل تحديث للسياسة. هنا يأتي دور إطار EDGE (تقطير التجارب للاستكشاف الموجه).
يعمل EDGE على معالجة هذه الإشكالية بتقديمه تجربة تعليمية مبتكرة، حيث يعامل التجارب المسترجعة كدعامات مؤقتة خلال زمن التدريب، مما يسمح بدمج فوائدها بشكل تدريجي في السياسة البارامترية. يتم تقسيم كل مجموعة من التمرينات إلى مسارات مشروطة بالتجارب وأخرى خالية منها، حيث يتم تقدير واعتماد المكاسب الإيجابية دون الحاجة إلى عيّنات إضافية.
عبر استخدام هدف KL العكسي على الدعم التجريبي الخاص بالنموذج، يتم تقطير السلوك المستند إلى التجارب إلى السياسة الأساسية. مما يجعل EDGE متميزًا، تتضمن تجربته المشتركة بنك تجارب يعزز إرشادات من أنماط الفشل الناشئة، مع تصريف العناصر القديمة مع تطور السياسة.
وبفضل هذا النهج المبتكر، تفوق EDGE على نموذج GRPO بسعر نجاح بلغ 8.3 و12.5 نقطة، بالمقارنة مع النماذج السابقة. وليس ذلك فحسب، بل احتفظ أيضًا بـ 96.0% من أدائه عند إزالة التجارب الخارجية في وقت الاستنتاج.
إذا كنت مهتمًا بمزيد من المعلومات حول هذا الابتكار، يمكنك زيارة رابط GitHub الخاص بالرمز.
ما رأيكم في تطور EDGE؟ هل ترون أنه سيحدث ثورة في مجال التعلم المعزز؟ شاركونا آرائكم في التعليقات!
اكتشاف نهج EDGE: ثورة في التعلم المعزز من خلال تحسين التجارب
تقدم EDGE (تقطير التجارب للاستكشاف الموجه) طريقة مبتكرة لتدريب وكالات التعلم المعزز، مما يعزز الأداء عبر استخدام التجارب التاريخية. يشير البحث إلى تحسينات كبيرة في نجاح المهام باستخدام النهج الجديد.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
