في عالم الذكاء الاصطناعي، يمثل **توحيد تعلم السياسات (Policy Learning)** وتنبؤ الحالة (State Prediction) عبر **نمذجة اللغة المكانية (Spatial Language Modeling)** خطوة مذهلة نحو تحسين قدرات التحكم في الروبوتات. يتيح لنا هذا الأسلوب التعرف على كيفية تأثير الأفعال على تغيير هندسة المشاهد، مما يقدم إشرافاً تكاملياً فعالاً لتحقيق الأهداف.

تساعد نمذجة اللغة المكانية على تمثيل حدود المشاهد، والأهداف، والأهداف السلوكية، والحالات المستقبلية من خلال مفردات مشتركة تتكون من إحداثيات وصفية ورموز دلالية. يتم تنظيم هذه العناصر وفق قواعد نحوية (Grammar) محددة للمهام، مما يسمح لنموذج **Transformers** التلقائي بتعلم توليد الأفعال وتنبؤ الحالة المرتبطة بها عبر هدف مشترك للتنبؤ التالي.

تم تدريب هذا النموذج من الصفر باستخدام أسلوب **pretraining** يعتمد على اللعب العشوائي، تلاه تدريب مشترك للأفعال والحالة مستنداً إلى العروض التوضيحية للخبراء. خلال مرحلة التدريب، يتم استبعاد إحداثيات الأفعال المسجلة من خسارة التنبؤ، مما يسهل النموذج على التنبؤ بالحالات التالية عند استعراض الأهداف القابلة للتنفيذ.

بفضل هذه التقنية الجديدة، تم تقييم النموذج على بيئة **Push-T** في المحاكاة وأيضاً على روبوت حقيقي، حيث أظهر أداءة تنافسية في المحاكاة وأعلى نسب نجاح في المهام مقارنة بالسياسات المتواجدة على الروبوتات الحقيقية. تظهر عمليات التقييم أيضاً أن السيطرة أفضل عندما يتم دمج تسلسلات الأفعال والحالات، مع زيادة ملحوظة من التدريب العشوائي.

من الرائع أن نرى كيف يمكن لنموذج واحد أن يتنبأ بالحالات التالية في المشهد، مما يلتقط التأثيرات الهندسية للأفعال، مثل الدفع. هذه الابتكارات ليست مجرد تطورات عابرة، بل تمثل نقلة نوعية في مجال الروبوتات الذكية وكيفية تعلمها من البيئات المحيطة بها.