في عالم الذكاء الاصطناعي، تُعتبر نماذج الرؤية واللغة والعمل (Vision-Language-Action) من أهم التطورات التي تسعى إلى دمج الفهم اللغوي مع القدرة على اتخاذ القرارات وتنفيذ الأفعال. وفي هذا السياق، تم إطلاق نموذج NebulaVLA، الذي يوفر حلاً مبتكراً للتحديات التقليدية في هذا المجال.

يعتمد NebulaVLA على معمارية ثنائية التردد غير المتزامنة (asynchronous dual-frequency architecture) التي تفصل بين التفكير الدلالي العالي المستوى والتحكم الحركي المنخفض المستوى، مما يُتيح استخدام موارد الحوسبة بكفاءة وبالتالي تعزيز المرونة.

ومن أهم مميزات NebulaVLA هو إدخاله لـ GESTURE-7، وهو تمثيل موحد للأفعال المعتمدة على اللغة، والذي يسهل الربط بين الروبوتات المختلفة. وتعتمد خوارزمية Guide Action على قيود السلاسة المبنية على الأقنعة لتحقيق تماسك حركي أفضل وبذلك تتمكن الروبوتات من تنفيذ الأفعال بسلاسة أكبر.

تشير التقييمات الشاملة إلى أن NebulaVLA تفوق بشكل كبير على النماذج المتزامنة التقليدية، حيث حقق معدل نجاح يبلغ 85.5% على مجموعة بيانات LIBERO-Plus، وزاد من سرعة توليد الأفعال بمعدل يصل تقريباً إلى 2.7 مرة!

تُظهر هذه التصميمات غير المتزامنة كيف يمكن الوصول إلى التحكم الفعّال والمستجيب في التطبيقات الروبوتية العملية، مما يمهد الطريق لمزيد من الابتكارات في هذا المجال.