في عالم الذكاء الاصطناعي، يعد تعلم التعزيز (Reinforcement Learning) أحد الأساليب الطبيعية لتدريب وكلاء نماذج اللغات الكبيرة (Large Language Models) على أداء مهام تفاعلية معقدة على المدى الطويل. لكن، يواجه هذا الأسلوب بعض التحديات، حيث تتلاشى فعاليته عندما يتم تقييم النجاح بناءً على نتائج نهاية المهمة فقط.
تم التوصل مؤخراً إلى تقنية جديدة تُعرف باسم CANOPY (Coverage-ANchored On-PolicY RL)، والتي تعد بحل هذه المشكلة عبر تضخيم استكشاف المهام ذات الصلة، مما يعيد إشعال الإشارات الطبيعية داخل عملية التعلم. تعتمد هذه الطريقة على الحفاظ على كل تحديث ضمن سياسة محددة وتقييده على الرموز الخاصة بإجراءات الوكيل فقط.
ما يجعل CANOPY مبتكرة هو قدرتها على تحقيق نتائج مبهرة دون الحاجة لدعم خارجي من إشارات الائتمان أو الإشراف المباشر، حيث تمكنت من الوصول إلى أعلى قائمة المتصدرين في معيار AppWorld، متفوقة على طراز Qwen3-14B بمفرده. أدت المبادئ التصميمية المماثلة أيضاً إلى تحسين أداء طراز Qwen3.5-9B بمعدل 16.6 نقطة.
تطرح التحليلات الرائدة هذه تساؤلات هامة حول كيفية إدماج القدرة طويلة الأمد بشكل مباشر في النماذج الصغيرة المفتوحة وتحويل الأساليب التقليدية للتدريب. كما تخطط أكاديمية علي بابا لنشر حزمة التدريب الكاملة عبر [رابط_المقال]. هل تعتقد أن هذا النهج سيعيد تشكيل طرق تدريب الذكاء الاصطناعي؟
تعلم التعزيز من خلال النتائج فقط: كيف ستغير CANOPY مستقبل الوكلاء التفاعليين!
تقدم تقنية CANOPY ثورة في مجال تعلم التعزيز، حيث تؤكد أن النجاح ليس مجرد هدف، بل نتيجة نهائية تفتح الباب لتطوير وكلاء تفاعليين على المدى الطويل. هل ستغير هذه الطريقة المفاهيم التقليدية لتدريب الذكاء الاصطناعي؟
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
