يسرنا أن نقدم لكم تطورًا ثوريًا في مجال تعلم الحركة الرباعية، حيث تواجه الأنظمة التقليدية تحديات في كفاءتها عند التدريب على الحركات الرباعية. غالبًا ما تتطلب هذه الأنظمة ملايين التفاعلات مع البيئات المحاكية لتحقيق تحكم مستقر. في أحدث الأبحاث، تم دمج تقنيات تعتمد على النمذجة لتحسين كفاءة البيانات من خلال تعزيز عمليات التشغيل باستخدام بيانات تركيبية وفق نهج ديناميكي.
تعتمد الطريقة الجديدة على نموذج انتقال تم تعلمه لتوليد ذيول تركيبية قصيرة لكل مسار، مع الحفاظ على الاستقرار من خلال محاكاة قائمة على الفيزياء. تتبنى هذه الاستراتيجية نموذج جدولة محدد يدريج إدماج الانتقالات التركيبية بشكل تدريجي، مما يمنع استخدام النموذج أثناء مراحل التدريب المبكرة حيث تكون دقة التنبؤ منخفضة.
تقدم الدراسة تحليلاً شاملاً لكيفية تأثير تعديل معلمات البيانات على سلوك التعلم لنموذج PPO (Proximal Policy Optimization). وأكدت التجارب في المحاكاة على روبوت Unitree Go1 على تقارب الطريقة الجديدة مع تقليل عدد خطوات المحاكاة المطلوبة بشكل كبير من 27.53 مليون إلى 19.64 مليون، مع انخفاض بنسبة 12.24% في زمن التدريب دون التأثير على أداء السياسة.
التجارب عبر المنصات على كل من ANYmal وUnitree Go2 أكدت قدرة هذه الإطار على تعلم التحكم في الحركة العالية الأبعاد مع تقليل التجارب المحاكية، على الرغم من بعض المقايضات في المكافآت فيما يتعلق بالأشكال المعقدة. هذا التطور قد يفتح أفقاً جديداً في كيفية تدريب الروبوتات لتحقيق نتائج فعالة وسريعة.
تعلم السير بكفاءة أعلى: نهج ديناميكي لأسلوب الحركة الرباعية
يعتبر تعلم الحركات الرباعية نموذجًا تحديًا تقنيًا، لكن مع طريقة ديناميكية جديدة، يمكن تحقيق كفاءة أكبر وتقليل الوقت المطلوب للتدريب. استكشاف نموذجي لاستجابة وفعالية عالية أفضل من الطرق التقليدية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
