أعلنت مجموعة من الباحثين عن تطوير تقنية جديدة تُدعى A-3PO (Approximate Proximal Policy Optimization)، التي تهدف إلى تسريع تدريب نماذج اللغات الضخمة (Large Language Models) من خلال معالجة مشكلة الاستدامة العالية للبيانات في بيئات التعلم المعزز.

تمثل تقنية Decomposed PPO (Decoupled Proximal Policy Optimization) خوارزمية فعّالة في التعلم المعزز، حيث تعالج تغيير البيانات بشكل مستدام عبر الفصل بين تصحيح السياسات المتاحة (off-policy correction) ومتطلبات تحديث السياسات (policy update constraint). ومع ذلك، يتطلب البروكسيما للسياسات (proximal policy) جولة إضافية في النموذج عند كل خطوة تدريبية، مما يزيد من الحمل الحاسوبي خلال تدريب نماذج اللغات الضخمة.

لذا، لاحظ الباحثون أنه يمكن تقريب البروكسيما للسياسات عبر تداخل بسيط دون الحاجة لحسابات معقدة. ولقد أثبتت تجارب هذه التقنية الجديدة تسريع عملية التدريب بشكل يصل إلى 1.8 مرة، مما يُحقق كفاءة أعلى مع الحفاظ على الأداء المرغوب فيه.

تمت مشاركة الكود والنماذج التطبيقية مع المجتمع العلمي عبر نظام التدريب المفتوح المصدر AReaL. تعد هذه التقنية فتحاً جديداً في عالم الذكاء الاصطناعي وتطبيقاته العملية، فتح الباب نحو مستقبل أكثر إشراقاً لتعلم الآلة وتعزيز كفاءة الأنظمة الذكية.