في عالم الذكاء الاصطناعي، تعتبر نماذج الرؤية-اللغة-الإجراء (VLA) من أبرز الابتكارات، وقد حققت هذه النماذج في السنوات الأخيرة أداءً مدهشاً في معالجة الروبوتات. يعتمد نجاح هذه النماذج بشكل كبير على إطارات العمل التوليدية مثل Flow Matching، التي تسمح لهذه النماذج بتعلم توزيعات مسارات الإجراءات الشرطية.

تختلف Flow Matching عن السياسات الحتمية، بحيث تمكن النموذج من استنتاج إجراءات متعددة تحت نفس السيناريو الوظيفي بفضل استخدام متجهات الضوضاء الكامنة. ومع ذلك، تظهر إحدى التحديات الكبرى أن هذه التوزيع غالباً ما تكون غير مُنظمة بشكل جيد، حيث تتواجد سلوكيات ناجحة وأخرى فاشلة معاً، ما يعني بقاء كتلة كبيرة من الاحتمالات في مناطق غير مرغوبة.

في هذا السياق، نقترح إطار العمل Online-ES، الذي يعتمد على استراتيجية التطور (ES) للتكيف عبر الإنترنت مع VLA، حيث يقوم هذا النظام بتحسين توزيع مسارات الإجراءات المتعلم من خلال التفاعل وردود الفعل. بدلاً من تقليم مساحة الضوضاء الكامنة، يقوم منهجنا مباشرة باستكشاف المساحة المتعلقة بمسارات الإجراءات، حيث توفر المسارات المتنوعة الناتجة عن Flow Matching حلولاً محتملة للتكيف.

من خلال تعديل المسارات المُختارة وتقييم نتائج تنفيذها، نستطيع استنتاج هدف مربعات الخطأ الذاتي (MSE) الذي ينقل اتجاه التطور من مساحة المسارات إلى مساحة معالم النموذج. رياضياً، نثبت أن الهدف المقترح يوفر تقديرًا غير متحيز لاتجاه التطور الأمثل. بالإضافة إلى ذلك، نقوم بإدراج تجارب الفشل كمدخلات سلبية لإعادة تسوية اتجاه التطور، ما يساعد في توجيه السياسة بعيداً عن المناطق التي تم استكشافها مسبقاً.

تظهر التجارب التي أجريت في كل من البيئات المحاكية والواقعية أن Online-ES يحقق تحسيناً في السياسات يتماشى مع تحسين التعزيز (reinforcement fine-tuning) دون الحاجة إلى تعلم نموذج قيمة أو حساب المزايا. هذا التطور يعد بمثابة علامة فارقة في تحسين تقنيات التحكم في الروبوتات ويعكس إمكانات الذكاء الاصطناعي في تحقيق تحسينات مستمرة دون الاعتماد على التعلم التقليدي.