في عالم الذكاء الاصطناعي، تأتي الابتكارات لتحسين أداء الروبوتات بشكل دوري. أحدث هذه الابتكارات هو الإطار الموحد الذي يتيح تقنيات جديدة في تحسين سياسات الروبوتات باستخدام التعلم المعزز (Reinforcement Learning - RL). حيث يعاني الكثير من نماذج الروبوتات التقليدية من مشكلات مرتبطة بعمليات ما قبل التدريب (Pre-training) مثل تقنيات التمثيل السلوكي (Behavioral Cloning - BC) التي تنتج توزيعًا محدودًا للأفعال. لذا، تم تقديم أسلوب متقدم يسمى "تدريب ما قبل السياق المسموح" (Context-Smoothed Pre-training - CSP) والذي يمكن الروبوتات من إجراء استكشافات أكثر فعالية من خلال إدخال ضوضاء انسيابية في مدخلات السياسات، وذلك لخلق توازن بين التقليد الدقيق وتغطية الأفعال الشاملة.
بعد ذلك، يتم تحسين سياسات الروبوتات المدربة مسبقًا باستخدام التعلم المعزز المعتمد على توقيت التحفيز (Timestep-Modulated Reinforcement Learning - TMRL)، بحيث يقوم بتعديل هذا التحفيز الديناميكي خلال عملية التحسين، مما يمنح التحكم الواضح على عمليات الاستكشاف.
تكامل هذه الطريقة بسلاسة مع مدخلات السياسات المختلفة مثل الحالات، والسحب ثلاثية الأبعاد، والسياسات المعتمدة على الصور. وقد أظهرت النتائج أن TMRL تعزز كفاءة عملية تحسين التعلم المعزز، حيث تمكنت من تحقيق تحسينات كبيرة في أداء الروبوتات في مهام المعالجة المعقدة في أقل من ساعة. ما يثير الدهشة هو أن جميع هذه المعلومات والأدوات متاحة عبر الرابط لتسهيل العمل على الباحثين والمهتمين.
ابتكار مذهل في عالم الروبوتات: استراتيجية جديدة لتحسين أداء السياسات باستخدام TMRL!
طرحت دراسة جديدة طريقة مبتكرة لتحسين أداء سياسات الروبوتات من خلال تقنية TMRL، التي تزيد من كفاءة عملية التعلم. هذه التقنية قد تغير مستقبل إدارة الروبوتات المعقدة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
