في عالم الذكاء الاصطناعي، يمثل التوازن بين دقة نماذج الرؤية واللغة والعمل (Vision-Language-Action Models) والتعقيد الحاسوبي تحديًا كبيرًا. غالبًا ما يضطر الباحثون لاختيار دقة أعلى على حساب زمن التنفيذ، أو التعقيد المنخفض بتضحيات في نسبة نجاح المهمة.
تقدم الورقة البحثية الجديدة نموذج Mamba كحل مبتكر للتغلب على هذه القيود. حيث يستخدم هذا النموذج نمذجة الحالة الانتقائية لتحسين آلية التنفيذ في نموذج SmolVLA المعروف بدقته العالية وتعقيده المنخفض.
تجري التجارب على مجموعة من المعايير المرجعية LIBERO عبر ثلاثة أفق تنفيذ مختلفة، حيث أظهرت النتائج أن نموذج Mamba يحقق نجاحات ملحوظة عندما يزيد عدد الأفعال المنفذة قبل إعادة التخطيط، مُتفوقًا بفارق يصل إلى 7.8% مقارنة بالنموذج التقليدي القائم على تحويل (Transformer) عند تنفيذ 50 فعلًا.
تأتي هذه النتائج لتظهر قدرة Mamba على الحفاظ على النجاح حتى في فترات التنفيذ الطويلة، مما يعد خطوة مهمة نحو تطبيقات ذات جدوى في العالم الحقيقي. يُظهر نموذج Mamba أيضًا كفاءة في تقليل التعقيد العام للنموذج، حيث تمكن من تقليص عدد المعاملات بنسبة 24% مقارنة بالنموذج القائم على Transformer.
إن هذا البحث يفتح آفاقًا جديدة في كيفية استخدام نماذج VLA في التطبيقات المستقبلية، ويتحدى الأفكار التقليدية حول طريقة تنفيذ المهام في الذكاء الاصطناعي. لنترقب ما ستسفر عنه التطورات القادمة في هذا السياق!
تحسين دقة نماذج الرؤية واللغة والعمل: كيف يغير نموذج Mamba قواعد اللعبة؟
تقدم الدراسة الجديدة عن نموذج Mamba تحسينًا مذهلاً في توازن الدقة والتعقيد لنماذج الرؤية واللغة والعمل، مما يتيح تنفيذ المهام بشكل أكثر فعالية. اكتشفوا كيف يتفوق هذا النموذج على تقنيات سابقة بنسبة تصل إلى 7.8%!
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←# نموذج Mamba# الذكاء الاصطناعي# التوازن بين الدقة والتعقيد# نماذج الرؤية واللغة# تكنولوجيا التعلم العميق
جاري تحميل التفاعلات...
