في عصر تتسارع فيه الابتكارات التكنولوجية، يبرز نموذج GlanceWAM كواحد من الحلول الرائدة التي تعالج التحديات الكبرى في تعلم الروبوتات. يعتمد هذا النموذج على نماذج توليد الفيديو، والتي تقدم افتراضات فيزيائية غنية تلبي احتياجات نماذج العالم-الفعل (World-Action Models).

ورغم أن نماذج العالم-الفعل التقليدية تواجه مأزقًا أساسيًا يتمثل في التوليد المتزامن للفيديو، مما يسبب تأخيراً غير مقبول في التحكم، فإن GlanceWAM يقدم حلاً يتمثل في تخيل الصور بشكل غير متزامن.

ما يميز GlanceWAM هو قدرته على تحقيق استنتاجات فورية بمعدلات نجاح عالية. يعتمد النموذج على هيكل فيديو مشترك، حيث يقوم "مقترح غير متزامن" بالنظر بعيدًا إلى المستقبل على مدار زمني بطيء ليخمن إطارًا واحدًا في الخلفية. في الوقت نفسه، يقوم "رأس العمل" بترميز أقسام العمل بمعدل تحكم يصل إلى 48 مللي ثانية دون أي تأخير.

تجري عملية التدريب على GlanceWAM من خلال العروض التوضيحية فقط، حيث حقق النموذج نسبة نجاح بلغت 72.2% في معيار مطبخ RoboCasa المكون من 24 مهمة (مقارنةً بـ 67.1% لنموذج Cosmos المتزامن) و99.0% على LIBERO.

لا عجب أن GlanceWAM أحدث ثورة في طريقة التحكم الآلي، حيث يقلل من زمن التأخير بمعدل يصل إلى 24 مرة مقارنة بالنماذج الأخرى.

إذا كنت مهتماً بالعالم المتقدم للذكاء الاصطناعي وتطبيقاته في الروبوتات، فلا تفوت فرصة التعرف على هذا الابتكار المذهل! ما رأيكم في هذا التطور؟ شاركونا في التعليقات.