في عالم الذكاء الاصطناعي المتقدم، برزت نماذج الرؤية واللغة والعمل (Vision-Language-Action) كأحد الأسس الواعدة للذكاء الاصطناعي المتجسد، ولكن تكلفة الاستدلال العالية تُمثّل تحدياً كبيراً عند نشرها في الأنظمة الروبوتية. وفي معظم الحالات، يواجه الاستدلال على الأجهزة قيوداً من حيث القدرة الحاسوبية وميزانيات الطاقة، مما يجعله صعباً في تلبية متطلبات التحكم في الزمن الحقيقي وكفاءة الطاقة في نفس الوقت.

تعد سياسة نقل عبء الاستدلال إلى خادم خارجي حلاً بديلاً، ولكنها معرضة لتقلبات في ظروف النظام، مما يسبب مخاطر غير متوقعة في التأخير. على الرغم من أن المشاركة بين الأجهزة والخوادم تبدو وعداً مُحتملاً، إلا أن البحث المنهجي المصمم خصيصًا لنماذج VLA لا يزال نادرًا، وخاصة إطار العمل الموحد الذي يعالج بشكل مشترك قيود الزمن الحقيقي وكفاءة الطاقة على مستوى النظام.

لذا، نعرض لكم EcoVLA، الإطار المتكيف للمشاركة بين الأجهزة والخوادم لنماذج VLA الذي يعزّز كفاءة الطاقة في النظام في إطار قيود الزمن الحقيقي. يبدأ EcoVLA بإدخال تجريد موحد على مستوى المرحلة عبر نماذج VLA المختلفة، مما يُسهل تصميم مشترك غير مرتبط بالهندسة للمشاركة.

من خلال صياغة نموذج لتوقع زمن الانتقال واستهلاك الطاقة على مستوى الأجهزة والخوادم، يتيح EcoVLA تقييماً سريعاً للخطط المشارَكة المحتملة. يعتمد EcoVLA في عمله على تحديد خطة مثلى من حيث استهلاك الطاقة تتوافق مع قيود الزمن الحقيقي مع تأخير يصل إلى مستوى المللي ثانية، متكيفاً مع التغيرات الديناميكية في الشبكة وحالات النظام.

علاوة على ذلك، يدمج EcoVLA آلية نقل خفيفة الوزن للموارد الوسيطة بين المراحل لتقليل تحميل الاتصال الناتج عن التعاون عبر الأجهزة. أظهرت النتائج التجريبية لنماذج VLA أن EcoVLA يُحسّن كفاءة الطاقة في النظام بنسبة تصل إلى 236% مقارنة بأساليب المشاركة الحالية، بينما يحافظ على تحقيق متطلبات مستوى الخدمة (SLO) تحت ظروف الشبكة الديناميكية وأحمال العمل في الأطراف.