في خطوة جديدة محورية في عالم الذكاء الاصطناعي، يبرز نموذج CoTinyVLA الذي يجمع بين الرؤية، اللغة، والإجراءات، ليعد حلولًا مبتكرة في تطبيقات الروبوتات. تعاني معظم النماذج الرائدة من قيود ضخمة تتعلق بالحجم والذاكرة، حيث تعتمد على نماذج تتراوح من ثلاثة إلى سبعة مليارات معلمة، مما يجعلها غير مناسبة للعديد من التطبيقات الروبوتية العملية.

يتميز CoTinyVLA بحجم يسمح له بالعمل بكفاءة فعالة، حيث يحتوي على 0.9 مليار معلمة فقط، ويعتمد على هيكلية Qwen3.5-0.8B. يحقق هذا النموذج تحسنًا ملحوظًا في الأداء بفضل تنظيم الإشراف بدلاً من توسيع حجم النموذج.

يتكون CoTinyVLA من ثلاثة مكونات رئيسية تستهدف مختلف محاور المشكلة:
1. **الإدخال الزمني المزدوج**: حيث يتم استخدام 16 إطارًا تاريخيًا في كل خطوة مع علامات نصية للكاميرا والوقت.
2. **تحليل التسلسلات الهرمية** (Chain-of-Thought): يتم تنفيذ عملية تحسين على مستويات مختلفة تبدأ من نموذج تدريبي قوي مكون من 35 مليار معلمة.
3. **زيادة صياغة الأوامر**: تتوسع 40 أمرًا أساسيًا لتصل إلى 800 نسخة مختلفة، مما يعزز القدرة على التعامل مع المهام المتنوعة.

عند اختباره على معيار LIBERO-Plus، حصل CoTinyVLA على نتائج مذهلة، حيث وصل إلى 90.8% في الأداء المكاني، و87.3% في أداء الكائنات، و86.6% في الأهداف، و80.7% في الطول، متفوقًا على أقوى نموذج بقدرة 7 مليارات معلمة.

تشير النتائج إلى أن CoTinyVLA يحقق تقدمًا ملحوظًا خاصة في المحاور الصعبة، حيث تصل دقة الأهداف إلى 73.6%، بينما لم يتجاوز النموذج الأكثر قوة 39.9% في نفس السياق.

الخلاصة، يعتمد CoTinyVLA على إشراف منظم يمكنه من تجاوز النموذج السابق الكبير الحجم، ويصل الحد الأقصى إلى 2.25 جيجابايت من ذاكرة GPU المخصصة لتحليل البيانات.

فهل أنتم مستعدون لاستكشاف الإمكانيات المذهلة لهذا النموذج الجديد؟ شاركونا آراءكم وتجاربكم في التعليقات.