في عالم الذكاء الاصطناعي، يعد التحكم الفعال في الروبوتات من الأمور المعقدة التي تعتمد على التعلم من الملاحظات والتغذية الراجعة. غالباً ما تقوم السياسات المدربة عبر تعلم التقليد، مثل "تقسيم الحركة باستخدام المتحولين" (Action Chunking with Transformers - ACT)، بتحقيق أداء ممتاز في ظروف مثالية. لكن، تكمن المشكلة عندما تتعرض تلك السياسات لأخطاء بسيطة في التنفيذ أو تغييرات في التوزيع، مما يؤثر على فعاليتها.

لحل هذه المشكلة، تم تقديم تقنية جديدة تُعرف باسم "تكييف السياسات المتبقية على الإنترنت" (Online Residual Policy Adaptation - ORPA). هذه التقنية تسمح بتصحيح فوري لتصرفات الروبوت المستندة إلى التغذية الراجعة، دون الحاجة إلى تعديل المعلمات الأساسية للسياسة المتبعة. بدلاً من ذلك، تقوم ORPA بتعزيز سياسة التحكم المدربة مسبقًا بوحدة خفيفة الوزن تعتمد على مدخلات التغذية الراجعة، مما يتيح لها تقدير التعديلات الضرورية مباشرة في مساحة المفاصل.

تم تقييم فاعلية ORPA عن طريق تنفيذها على مجموعة من مهام المناورة الحساسة للدقة باستخدام منصة ALOHA، حيث أظهرت تحسنًا ملحوظًا في معدل النجاح والقدرة على التعافي من الانحرافات الصغيرة، مقارنة بالسياسات التقليدية القائمة على القواعد وتصحيحات الديناميكية العكسية.

هذا التطور الجديد يعد خطوة هامة نحو تعزيز قدرة الروبوتات على التكيف والتعامل مع الظروف الطبيعية الديناميكية، ويحقق كذلك تقدمًا نحو تحقيق نشر فوري وفعال للأنظمة المستندة إلى الذكاء الاصطناعي.