في عالم التعلم المعزز (Reinforcement Learning - RL)، تتزايد الحاجة إلى بيئات تدريب متنوعة ومتخصصة. بينما كانت البيئات المخصصة تقوم بتحديات ثابتة، أصبحت هذه الطرق غير فعالة مع تحسن أداء النماذج.

وكنتيجة لذلك، برزت نماذج العالم (World Models) التي تحاكي حالات البيئات كبديل واعد لتوسيع نطاق التنوع عند الحاجة. ومع ذلك، فإن نماذج العالم التلقائية (Autoregressive - AR) عانت من تحيز في الاتجاه من اليسار إلى اليمين، مما أعاق قدرتها على معالجة حالات المرتبطة بشكل عالمي.

في هذا السياق، تم تقديم نموذج 'Masked Diffusion Language' (MDLM)، وهو نموذج ثوري يمكنه تحقيق أداء أفضل في معالجة النصوص من خلال تطوير بيئات تدريب متعددة الاستخدامات. بناءً على تحليل شامل لـ239,403 مساراً معتمداً عبر تسعة بيئات مفتوحة المصدر، يمكن لموديلات 'MDLM' تحقيق تجانس أعلى وواقعية أكثر، في حين توفر تنوعاً أكبر في النتائج.

تم تقديم إطار تدريب 'GRPO' القابل للإضافة - والذي يوفر فحوصات صارمة للحالات المحددة - بالإضافة إلى تحسين استراتيجيات النقل لصالح ثلاث بيئات خارج المجال. مع هذه الإنجازات، تمكنا من تحقيق زيادات تصل إلى 47% في الأداء من دون الحاجة إلى تعديل خاص بالبيئات.

كما قمنا بإجراء تحليلات سلوكية لمهام الفشل في سيناريوهات معادية وتقييمات بشرية حول مدى واقعية النتائج وجودة التدريب.

تم فتح مصدر أعمالنا بهدف تعزيز البحث في هذا الاتجاه، مما يتيح للجميع فرصة الاستفادة من التطورات التي نقدمها. ما الذي تنظرون إليه في مستقبل الذكاء الاصطناعي؟