في عالم التعلم المعزز (Reinforcement Learning - RL)، تتزايد الحاجة إلى بيئات تدريب متنوعة ومتخصصة. بينما كانت البيئات المخصصة تقوم بتحديات ثابتة، أصبحت هذه الطرق غير فعالة مع تحسن أداء النماذج.
وكنتيجة لذلك، برزت نماذج العالم (World Models) التي تحاكي حالات البيئات كبديل واعد لتوسيع نطاق التنوع عند الحاجة. ومع ذلك، فإن نماذج العالم التلقائية (Autoregressive - AR) عانت من تحيز في الاتجاه من اليسار إلى اليمين، مما أعاق قدرتها على معالجة حالات المرتبطة بشكل عالمي.
في هذا السياق، تم تقديم نموذج 'Masked Diffusion Language' (MDLM)، وهو نموذج ثوري يمكنه تحقيق أداء أفضل في معالجة النصوص من خلال تطوير بيئات تدريب متعددة الاستخدامات. بناءً على تحليل شامل لـ239,403 مساراً معتمداً عبر تسعة بيئات مفتوحة المصدر، يمكن لموديلات 'MDLM' تحقيق تجانس أعلى وواقعية أكثر، في حين توفر تنوعاً أكبر في النتائج.
تم تقديم إطار تدريب 'GRPO' القابل للإضافة - والذي يوفر فحوصات صارمة للحالات المحددة - بالإضافة إلى تحسين استراتيجيات النقل لصالح ثلاث بيئات خارج المجال. مع هذه الإنجازات، تمكنا من تحقيق زيادات تصل إلى 47% في الأداء من دون الحاجة إلى تعديل خاص بالبيئات.
كما قمنا بإجراء تحليلات سلوكية لمهام الفشل في سيناريوهات معادية وتقييمات بشرية حول مدى واقعية النتائج وجودة التدريب.
تم فتح مصدر أعمالنا بهدف تعزيز البحث في هذا الاتجاه، مما يتيح للجميع فرصة الاستفادة من التطورات التي نقدمها. ما الذي تنظرون إليه في مستقبل الذكاء الاصطناعي؟
نموذج 'Masked Diffusion Language': ثورة في تعلم الآلة وإعادة تشكيل بيئات الذكاء الاصطناعي!
تقديم نموذج 'Masked Diffusion Language' كحل مبتكر لتحسين التعلم المعزز، حيث يتفوق هذا النموذج في التنوع والواقعية مقارنة بالنماذج السابقة. هذا التطور يعد خطوة هامة نحو خلق بيئات تدريب متقدمة للذكاء الاصطناعي!
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
