تُعتبر عملية استنساخ السلوك (Behavior Cloning) في البيئات غير الماركوفية (Non-Markovian Environments) مُشكلة تُعاني الكثير من التحديات، حيث يتوجب على السياسات استنتاج المعلومات السياقية على مدى فترات طويلة. تعتمد الهياكل الحالية للسياسات على آليات متعلقة بالقنوات المتكررة أو الانتباه لالتقاط الاعتمادات الطويلة الأمد. ومع ذلك، تواجه النماذج المتكررة مشاكل انهيار الحالة المخفية وعدم استقرار التدرجات عند الانتقال عبر الزمن، بينما تعاني نماذج الانتباه من حدود أساسية في طول السياق.

**الفكـرة الجديدة: إطـــار الاسترجاع الذاتي**
لتجاوز هذه القضايا، يقدم الباحثون مفهوم "المفاهيم الاسترجاعية" (Keyframe Mnemonics)، وهي طريقة ذاتية الإشراف تكتشف مجموعة من المشاهد الحاسمة (المفاهيم) من خلال تعلم أهداف من مشاهد سابقة مُنتقاة عشوائياً واستخدامها كمكافأة لاختيار الإطارات الرئيسية. يتم بعد ذلك تدريب سياسة استنساخ السلوك التي تعتمد على الإطارات الرئيسية المكتشفة لنمذجة توزيع الأفعال.

تحت بعض افتراضات هيكل المهمة، توفر هذه الصياغة ضمانات للاحتفاظ بالسياق على مدى غير محدود، مع الحفاظ على مجموعة صغيرة من الإطارات الرئيسية ذات الصلة بالقرار في ذاكرة العمل للسياسة.

قامت التقييمات على مجالات الذاكرة الاصطناعية (Synthetic Memory Domains)، حيث حققت السياسات التي تعتمد على المفاهيم شروط نجاح بنسبة 100٪ وتعميم الأداء على مدارات زمنية تفوق أضعاف ما تم تدريبه دون تدهور في الأداء.

علاوة على ذلك، تم تقييم الأسلوب على معيار تحريك الروبوتات ذي الذاكرة العالية، حيث حقق تحسناً قدره 13.9٪ في نسبة النجاح المطلقة في المتوسط على مدى 23 مهمة، مع الاحتفاظ بنسبة 80٪ من النجاح عند الراحة في فترات زمنية أطول بـ20 مرة على روبوت حقيقي.
للاطلاع على الكود والفيديوهات، يمكن زيارة الموقع الرسمي.