في تطور مذهل في عالم الروبوتات الذكية، تم الإعلان عن تقنية جديدة تدعى PROMO (تعلم التعزيز متعدد الأهداف المشروط بالتفضيلات)، والتي تعد بمثابة ثورة في كيفية توجيه الروبوتات الرباعية في بيئات متنوعة ومتغيرة. يحتاج تنقل الروبوتات الرباعية إلى تحقيق توازن دقيق بين أهداف متضاربة مثل تتبع الأوامر والاستقرار وكفاءة الطاقة. بدلاً من الاعتماد على نموذج مكافأة ثابت أثناء التدريب، تقدم PROMO منهجاً مبتكراً حيث تجعل هذا التوازن مدخلًا صريحًا خلال وقت التنفيذ لمجموعة من السياسات الحركية.
تعتمد PROMO على تفضيلات المستخدم أثناء النشر، مما يسمح بتحديد نية المشغل بشكل واضح بعيدًا عن مصطلحات تحفيز المكافأة الضرورية لإنشاء خطوات حركية ناجحة. ووفقاً للدراسات التجريبية، حققت PROMO نتائج رائعة مقارنة بالتحكم الثابت وبخطوط الأساس متعددة الأهداف، مما يدعو لتقديم سياسة قابلة للنشر تعزز من قدرة الروبوتات الرباعية في مرورها على 100 تفضيل مختار في المحاكاة.
من خلال أكثر من 67 سلوكاً غير مهيمن وفقاً لما يسمى بـ "هيمنة باريتو"، أظهرت النتائج أن السياسة المستخدمة حققت تغطية باريتو واسعة واستجابة متوقعة للتفضيلات. والأهم من ذلك، تم نقل هذه السياسة بنجاح إلى وحدة Robot من طراز Unitree Go2، حيث أدت التغييرات البسيطة في التفضيلات إلى تقليل الطاقة المطلوبة بنسبة تصل إلى 30.4%، وتقليل خطأ الموضع بنسبة 38.7%، وفي الانحراف الأقصى للجسم بنسبة 59% بالنسبة للتفضيلات المتوازنة.
تمثل هذه النتائج أداة عملية لتطبيق تعلم التعزيز متعدد الأهداف المشروط بالتفضيلات كواجهة زمنية قابلة للتكيف لتحسين النقل لدى الروبوتات ذات الساقين، مما يعكس دورها المتقدم بعد أن كانت تقتصر على إنشاء مجموعة باريتو خارج الخط. لمزيد من المعلومات، يمكنكم زيارة الموقع الرسمي الذي يتضمن الكود المفتوح ومقاطع الفيديو التوضيحية.
اكتشاف ثوري في الروبوتات الرباعية: تقنية PROMO لتعلم التعزيز متعدد الأهداف
تقدم تقنية PROMO الجديدة طريقة مبتكرة لتعلم التعزيز في الروبوتات الرباعية عبر فصل نية المستخدم عن تحفيز المكافآت. هذه التقنية تمثل خطوة كبيرة نحو تحسين التنقل الذكي والديناميكي للروبوتات.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
