تعتبر أعمال المصانع واحدة من المجالات الواعدة لتطبيق الذكاء الاصطناعي المتجسد (Embodied AI)، حيث تتيح إسناد الوظائف اليدوية المتكررة إلى الروبوتات، مما يساعد في توفير فوائد اقتصادية ملحوظة. ومع هيمنة نماذج رؤية-لغة-عمل (VLA) كإطار عمل متبع لهذه الروبوتات، فإن زمن الاستنتاج لهذه النماذج يتأثر بشكل مباشر بمدى استجابة الروبوت وسلاسة حركته.

لكن، الإطارات الحالية للاستنتاج لنماذج VLA لا تستغل بشكل كامل خصائص عبء العمل الخاص بالمتطلبات المتكررة، ولا تأخذ في الاعتبار العوائق المميزة في مراحل الاستنتاج المختلفة. في هذا السياق، يلقي البحث الجديد الضوء على عبء العمل المتجسد ويُظهر تشابهًا كبيرًا بين المهام المتكررة للروبوتات، والذي يمتد إلى الحالات الداخلية للنماذج أيضًا.

ولمعالجة هذه القضايا، قدم الباحثون rMuscle، وهو إطار عمل لاستنتاج VLA في الزمن الحقيقي مُستوحى من فكرة الذاكرة العضلية البشرية. يعتمد rMuscle على تشابه الأداء عبر executions المختلفة، عبر ذاكرة عضلية مزدوجة المراحل.

تستخدم ذاكرة السياق (Context Cache) لإعادة استخدام مخرجات رموز الصور، مما يقلل من الحسابات المطلوبة، في حين أن ذاكرة الحركة (Action Cache) تعيد استخدام أنماط تنشيط الخلايا العصبية مما يقلل من الوصول إلى الأوزان. كما أن إطار rMuscle يحافظ على خفض حجم ذاكرة التخزين والعبء الزمني للوصول من خلال إعادة حساب الذاكرة عبر الإنترنت، واسترجاع ذاكرة النافذة المنزلقة، ومشاركة القناع عبر خطوات التصفية المتتالية.

وقد أثبت rMuscle قدرته على تحقيق زيادة في السرعة تتراوح بين 1.29 إلى 1.42X على وحدات معالجة الرسوم (RTX 4090) ونظام Jetson Thor في تنفيذ مهام LIBERO، RoboTwin، والمهام الفيزيائية، مع الحفاظ على معدلات النجاح الأصلية على الروبوتات في العالم الحقيقي.

ما رأيكم في هذا التقدم المثير في الذكاء الاصطناعي؟ هل تعتقدون أن الذاكرة العضلية يمكن أن تغير مستقبل الروبوتات؟ شاركونا أفكاركم في التعليقات!