في مجال الذكاء الاصطناعي، تبرز الحاجة إلى آليات تعلم أكثر دقة وفاعلية. نجد أن التعلم المعزز المعتمد على الجماعات (Group-based Reinforcement Learning) قد أثبت فعاليته في تدريب نماذج اللغات الضخمة (Large Language Models) بعد التعليم. ومع ذلك، عند التعامل مع المهام متعددة الأدوار التي تعتمد على مكافآت نادرة، غالباً ما تواجه هذه الطرق تحديات في تخصيص الاعتمادات للأفعال المتوسطة.

تتجه الأبحاث الحديثة لتقديم حلول مبتكرة، ومن بينها تطوير تقنية تحت مسمى تحسين السياسة المدفوعة بالاحتمالات (Potential-Guided Policy Optimization - PGPO). تهدف هذه التقنية لتقدير الامكانات الدولة السلبية من خلال إحصائيات عائد مجموعة الحالة المرجعية، ومن ثم استخراج مزايا الأفعال بناءً على الفروقات في الامكانات بين الحالات المتجاورة.

تُمكن هذه المقاربة من دعم تخصيص اعتمادات أدق للأفعال، حتى في الحالات الفاشلة، حيث يُمكن أن تتبين الأفعال الفعالة بوضوح أكبر، مما يسهم في تحسين الأداء العام مقارنةً بأساليب التعلم المعزز المستندة إلى الجماعات.

أظهرت التجارب على منصات مثل ALFWorld وWebShop نتائج قوية مقارنةً بالطرق السابقة. ومن خلال التحليل الإضافي، اتضح أن PGPO يقدم إشارات ذات قيمة أكثر عند التعامل مع حالات الفشل، دون زيادة كبيرة في الوقت المستغرق للتدريب.

إن تقنية PGPO تمثل خطوة كبيرة نحو تحسين خوارزميات التعلم المعزز، مما يجعلها محط اهتمام الباحثين والمطورين في هذا المجال.

ما رأيكم في هذا التطور الجديد؟ شاركونا في التعليقات!