في عالم الذكاء الاصطناعي، يمثل التوازن بين دقة نماذج الرؤية واللغة والعمل (Vision-Language-Action Models) والتعقيد الحاسوبي تحديًا كبيرًا. غالبًا ما يضطر الباحثون لاختيار دقة أعلى على حساب زمن التنفيذ، أو التعقيد المنخفض بتضحيات في نسبة نجاح المهمة.

تقدم الورقة البحثية الجديدة نموذج Mamba كحل مبتكر للتغلب على هذه القيود. حيث يستخدم هذا النموذج نمذجة الحالة الانتقائية لتحسين آلية التنفيذ في نموذج SmolVLA المعروف بدقته العالية وتعقيده المنخفض.

تجري التجارب على مجموعة من المعايير المرجعية LIBERO عبر ثلاثة أفق تنفيذ مختلفة، حيث أظهرت النتائج أن نموذج Mamba يحقق نجاحات ملحوظة عندما يزيد عدد الأفعال المنفذة قبل إعادة التخطيط، مُتفوقًا بفارق يصل إلى 7.8% مقارنة بالنموذج التقليدي القائم على تحويل (Transformer) عند تنفيذ 50 فعلًا.

تأتي هذه النتائج لتظهر قدرة Mamba على الحفاظ على النجاح حتى في فترات التنفيذ الطويلة، مما يعد خطوة مهمة نحو تطبيقات ذات جدوى في العالم الحقيقي. يُظهر نموذج Mamba أيضًا كفاءة في تقليل التعقيد العام للنموذج، حيث تمكن من تقليص عدد المعاملات بنسبة 24% مقارنة بالنموذج القائم على Transformer.

إن هذا البحث يفتح آفاقًا جديدة في كيفية استخدام نماذج VLA في التطبيقات المستقبلية، ويتحدى الأفكار التقليدية حول طريقة تنفيذ المهام في الذكاء الاصطناعي. لنترقب ما ستسفر عنه التطورات القادمة في هذا السياق!