في عالم الذكاء الاصطناعي، يمثل التعلم المعزز (Reinforcement Learning) نظامًا معقدًا يتطلب تصميمًا دقيقًا لضمان فعاليته، خاصة عند العمل على مهام تتطلب تفاعلات طويلة ومتعددة الخطوات. ومن بين التحديات الرئيسية التي يواجهها العلماء في هذا المجال هي كيفية توزيع الاعتمادات بشكل يعكس مساهمة كل قرار في نجاح المهمة.
تأكيدًا على هذا التحدي، تم تقديم آلية جديدة تُعرف باسم Segment-level Hindsight Advantage Reweighting for Policy Optimization (SHARPO) التي تهدف إلى تحسين كيفية استخدام التعلم المعزز. بدلاً من الاعتماد على تحديد المكافآت على مستوى المسار بشكل محدود، تتيح SHARPO توزيع الاعتمادات بشكل أكثر دقة عند مستوى المقاطع البيئية.
تعتمد SHARPO على تقنية مستلهمة من أسلوب التقطيع الذاتي على سياسة التعلم (On-policy Self-distillation) حيث تقوم بحساب الفجوات في احتمالية السجل بين المعلم والطالب داخل كل مقطع. هذه الإشارة تُستخدم بعد ذلك لحساب مضاعف مقيد على ميزة تحسين السياسة الجماعية (Group Relative Policy Optimization - GRPO). يتم مشاركة هذا المضاعف بين جميع الرموز داخل المقاطع، مما يسمح بتباين الاعتماد اعتمادًا على أداء المقاطع المختلفة.
أثبتت SHARPO جدوى كبيرة من خلال تجاربها مع نموذج Qwen2.5-7B-Instruct، حيث تفوقت على نموذج GRPO والنماذج البديلة الأخرى مثل SDAR وRLSD وStepOPSD في اختبارات الأداء على كل من ALFWorld وWebShop. هذه النتائج تشير إلى أن SHARPO ليست مجرد تحسُّن بل تطور جذري في كيفية إدراك أداء نماذج الذكاء الاصطناعي.
هل تتوقع أن تشهد آليات جديدة مثل SHARPO مزيدًا من التطور في مجال الذكاء الاصطناعي؟ شاركونا آراءكم في التعليقات!
ثورة في التعلم المعزز: آلية SHARPO لتوزيع الاعتمادات تعزز أداء نماذج الذكاء الاصطناعي!
تمكّن آلية SHARPO الجديدة من تحسين أداء نماذج التعلم المعزز من خلال توزيع أفضل للاعتمادات عبر المقاطع البيئية. برزت هذه الآلية في اختبارات الأداء متفوقة على النماذج السابقة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
