في عالم التكنولوجيا المتقدمة، يعتبر تعلم السلوكيات القائم على الفيديو أحد مجالات البحث الواعدة. حيث يتيح ذلك للروبوتات تعلم تصرفات محددة دون الحاجة إلى تأشيرات للأفعال أو تقديم نماذج تحمل تطابقاً مع تلك الأفعال. لكن، يسجل التحدي الكبير في نقل المعلومات المفيدة لدى الروبوت من مقاطع الفيديو. فهل يمكننا معالجة هذه التحديات بطرق أفضل؟

نقدم لكم إطار عمل Video2STL، الذي يظهر قدرة مذهلة على تحويل مقاطع الفيديو التي تحتوي على ملاحظات بصرية فقط إلى مواصفات منطقية زمنية بارامترية (Parametric Signal Temporal Logic - STL). يعتمد هذا الإطار على نماذج التعلم المتقدمة لتكون أساسية في تعليم الروبوتات لتحقيق أهدافها.

من خلال هذا النظام، يستخرج نموذج الرؤية واللغة تسلسلاً زمنياً للأحداث بشكل مستقل عن الأجسام، مما يؤدي إلى إنشاء مجموعة من المواصفات الرمزية الزمنية. كما يقوم النموذج بتحديد هيكل المهام، بينما تُستمد عتبات المميزات العددية والقيود الزمنية من مسارات الروبوت الناجحة.

عند تعلم السياسات، يتم توزيع المعلومات الزمنية إلى فترات زمنية قصيرة وطويلة: حيث توفر المواصفات قصيرة الأمد مكافآت كثيفة من خلال قياس موثوقية متجانسة، بينما تضمن المراقبة السببية لمواصفات طويلة الأمد مكافآت تقدم لمرة واحدة للزمن المتسلسل الصحيح.

يجعل هذا التموضع أيضًا الانتقال بين الأشكال المختلفة أسهل؛ حيث يمكن للروبوتات أن تتعلّم من مقاطع الفيديو البشرية أو الحيوانية. في أربع مهام للتلاعب، حقق Video2STL معدل نجاح متوسط يبلغ 85.8% في الإنجاز الفوري و67.0% في الإنجاز في النهاية، مقارنةً بمعدل 81.5% و59.5% للنموذج التقليدي. وفي مجال السير الرباعي، حققت سياسات Video2STL المستندة إلى Qwen-3.8 وGPT-5.6 نجاح Hamburger مؤكد عبر سرعة تتراوح من 0.3 إلى 2.1 م/ث.

مجموعة النتائج هذا تدفعنا نحو مستقبل واعد؛ مستقبل يمكن أن يجلب الابتكار والتطور بشكل سريع في مجال الروبوتات! ما رأيكم في هذا التطور؟ شاركونا في التعليقات.