تعتبر مهمة تطوير استراتيجيات مناورات روبوتية قوية وتفاعلية تتكيف مع المعلومات السياقية المتغيرة من التحديات الكبرى في مجال الروبوتات. على مدار السنوات، ظهر نهج "التعلم من العرض" (Learning from Demonstration - LfD) كحل بسيط وفعال لتوليد سياسات تفاعلية، وخاصة من خلال اتباع الأساليب المعتمدة على أنظمة الديناميكيات (Dynamical Systems - DS).

ومع ذلك، تركز معظم الأساليب الحديثة القائمة على DS على معالجة قيود القوة، متجاهلةً تعديلات السياسات استجابةً للبيئة المحيطة. ونتيجة لذلك، تبقى هذه الابتكارات غير مرنة عند التعامل مع المتغيرات المعتمدة على المهمة.

في هذا الإطار الجديد، نُبني على الأبحاث السابقة حول دمج السياسات (Policy Fusion) وتقدير عدم اليقين (Uncertainty Quantification) لنقدم إطار سياسة تكيفي يجمع بين التلاعب القائم على المعلمات الخاصة بالمهام وخصائص القوة والتفاعل. نستخدم أسلوب LfD لاكتساب سياسة تعتمد على حالة الروبوت ومعلمات المهام منخفضة الأبعاد التي تعكس البيئة المحيطة.

نقوم بدمج السياسة المستفادة مع سياسات إضافية مدركة لعدم اليقين باستخدام صيغة "خليط الخبراء" (Mixture of Experts - MoE) لتحسين القوة في حالات عدم التوزيع (Out-of-Distribution - OOD) وسلوك التقارب.

تم تقييم هذا النهج على مجموعة بيانات LASA للكتابة اليدوية وعلى روبوت حقيقي مزود بـ 7 درجات حرية (DoF) في ثلاثة سيناريوهات: الإمساك الموجه بالقوة، ومناورة العناصر الغذائية القابلة للتشويه، والإمساك المركّز على الكائنات.