في عالم الذكاء الاصطناعي، يعد تعلم السياسات البصرية (Visual Policy Learning) أحد التحديات البارزة، حيث يتطلب تنسيق التفاعل مع البيئة المعقدة ويكلف موارد حسابية كبيرة. وبهدف تحسين هذا التعلم، قدم الباحثون تقنية جديدة تُعرف باسم البحث عن السياسات المدعومة بالعينة (Sampling-Guided Policy Search - SGPS).
تقوم هذه التقنية بدمج تكرار تحسين الهدف باستخدام التحكم القائم على النموذج (Model Predictive Control - MPC) مع تحسين السياسة من الدرجة الأولى (First-order Policy Gradients - FoPG). من خلال تقنيات استنساخ السلوك (Behavior Cloning)، تبدأ العملية بتقليد الأفعال التي تم الحصول عليها من عينات، ثم يتم التدريب من خلال تكرار تحسين النموذج مع توظيف تعيينات قصيرة الأجل من FoPG تحت حالات مبتدئة مقلوبة وديناميكيات عشوائية.
لقد أثبتت التجارب أنه عبر استخدام وحدة معالجة رسومية واحدة، يمكن لنموذج SGPS تعلم السياسات بكفاءة في التنقل وتجاوز العقبات ودفع الصناديق والحمل الثنائي على روبوتات صغيرة مثل Unitree Go2 و G1. كما أظهرت النتائج أن عملية التحسين تساهم في تعزيز تعلم السياسات بشكل يفوق ما يمكن تحصيله من خلال الانطلاق فقط.
عند تطبيقه على الأجهزة، تنتقل السياسة المستخلصة بشكل شبه فوري إلى روبوتات حقيقية مثل Go2، حيث تستخدم بيانات العمق المدمجة لتقوم بالتحرك بشكل ذاتي، الزحف، تجاوز الحواجز، والتنقل بين هذه السلوكيات بشكل سلس. هذه التقنية الجديدة تمثل خطوة هامة نحو تحسين التفاعل بين الروبوتات والبيئة المحيطة بها بشكل أكثر فاعلية وآلية.
ما رأيكم في هذه التطورات المثيرة في مجال الروبوتات والذكاء الاصطناعي؟ شاركونا أفكاركم في التعليقات!
تسريع تعلم السياسات البصرية باستخدام التحكم القائم على النموذج المدعوم بالعينة
ابتكر الباحثون طريقة جديدة لتسريع تعلم السياسات البصرية، مما يتيح تحسين الأداء في التنقل والتلاعب بالبيئة. تعتمد الطريقة على استخدام التحكم القائم على النموذج مع تحسينات على عمليات التدريب، مما يقلل من التكاليف الحسابية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
