في عالم الذكاء الاصطناعي المتطور، يواجه المهندسون تحديات جديدة في تحسين نماذج الرؤية واللغة والعمل (VLA). غالبًا ما تعتمد هذه النماذج على تجارب بشرية للتوجيه، مما يرفع من مستوى التعقيد وزيادة التكاليف. ومع ذلك، جاء إطار SynthDemo-RL ليضع حلاً مبتكرًا لتخطي حاجز المكافآت الصفرية، وذلك من خلال دمج التعلم الآلي بطريقة جديدة.
يقوم إطار SynthDemo-RL على مفهوم "المعلم والطالب"، حيث يقوم المعلم الآلي بتحويل بيانات المحاكي إلى مسارات فعالة للتحكم، مما يمكن نموذج VLA من التعلم من خلال تنظيم تحت إشراف (Supervised Fine-Tuning - SFT). بعد ذلك، يتم تحسين هذا النموذج عبر استخدام التعلم المعزز (Reinforcement Learning - RL) مع مكافآت ثنائية تعكس نجاح المهام.
أظهرت الأبحاث أن 27 من أصل 57 مهمة في "LIBERO-PRO"، وهو معيار عام للتحديات، تحقق نسبة نجاح صفرية عند استخدام نماذج تقليدية. لكن إطار SynthDemo-RL أنقذ جميع هذه المهام، حيث حقق نسبة نجاح متوسطة وصلت إلى 97.8% و97.1% على محاور الموقف والمهام.
تعتبر النتائج التي تم الحصول عليها ذكية ومذهلة، حيث يظهر أن تقنيات SynthDemo-RL ليست مجرد فكرة نظرية بل يمكن تطبيقها بشكل عملي على روبوتات فعلية، كما تم التحقق من ذلك في تجربتين على نموذج RoboTwin 2.0. هذا يتجاوز التوقعات، مما يفتح الأبواب لمزيد من الابتكارات في مجال الذكاء الاصطناعي.
تحطيم حاجز المكافآت الصفرية: تطبيق SynthDemo-RL في تكيف نماذج الرؤية واللغة والعمل
يقدم إطار SynthDemo-RL تقنيات ثورية لتحسين نماذج الرؤية-اللغة-العمل (VLA) عبر دمج التعليم الآلي. فقد أثبتت التجارب أنها قادرة على تحقيق نجاحات استثنائية دون الحاجة إلى تجارب بشرية جديدة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
