في عالم الذكاء الاصطناعي، نجد أن النماذج التلقائية لربط الرؤية واللغة والأفعال (Autoregressive Vision-Language-Action Models) تواجه تحديات في التفكير القائم على الأفعال المستمرة. غالبًا ما يتم تمثيل هذه الأفعال كترتيبات محددة من الرموز، وهو ما يتيح توقع الأفعال باستخدام أهداف توظيف الرموز التالية.

مؤخراً، تم تقديم نظام FAST الذي أظهر تحسينًا كبيرًا من خلال تشفير الأفعال ذات الترددات الزمنية المتنوعة بطريقة مدمجة، مما يقلل من عدد الرموز المطلوبة للتنبؤ بالأفعال. لكن على الرغم من ذلك، فإن هذا النوع من الضغط لا يحسن بالضرورة من كفاءة تعلم السياسات من التجارب المحدودة.

الآن، يقدم فريق بحثي نظام TOkenization of Action sequences with STochastic sampling (TOAST) الذي يبني على الأساس السابق ويستخدم طريقة عشوائية لتنسيق الأفعال، حيث يقوم بعينة من تنسيقات بديلة لنفس تسلسل الفعل الكمي أثناء تدريب السياسة.

يساهم هذا التنويع في الإشراف التلقائي، بينما يحافظ على الفعل الأساسي للروبوت ولا يتطلب أي تجارب إضافية. أظهرت التجارب التي أجريت على نموذج LIBERO أن TOAST يحقق تحسينات دائمة مقارنة بالنموذج الثابت، مع زيادة في معدل النجاح تصل إلى 6.8 نقاط عند استخدام 1/16 فقط من بيانات التدريب. كما حقق TOAST تحسينًا بمتوسط سرعة نجاح قدره 15.8 نقطة عبر أربع مهام حقيقية للروبوت، مما يبرز فعالية هذه الطريقة العشوائية في تعلم سياسات الروبوت خصوصاً عند وجود بيانات تدريب محدودة.

إنه حقًا تطور مثير في مجال الذكاء الاصطناعي، يبشر بآفاق جديدة في كيفية تعلم الروبوتات وتفاعلها مع البيئة.