في عالم الذكاء الاصطناعي، تعد النماذج المتكاملة مثل نماذج الرؤية-اللغة-الإجراء (VLA) من أبرز الابتكارات، إذ تقدم إمكانيات هائلة في تحسين التفاعل بين البيانات البصرية واللغوية والإجراءات الحركية. ولكن، كان الاعتبار الأكبر هو زمن الاستدلال المرتفع الذي يتطلبه تنفيذ هذه النماذج على وحدات المعالجة الرسومية (GPU)، مما يعيق استخدامها الفوري في تطبيقات الواقع الحقيقي.
لذا، تم تقديم إطار VQVLA، الذي يعد بمثابة تصميم مشترك بين الخوارزمية والأجهزة، ليقوم بتسريع استدلال VLA من خلال استغلال تشابه الأوزان وديناميكيات التنفيذ. تعتمد الاستراتيجية الأساسية في هذا الإطار على تقنية جديدة تُعرف باسم MotionVQ، وهي تقنية قادرة على تعديل دقة الكوانتيز بشكل ديناميكي وفقًا لحالة تنفيذ الروبوت. هذا التعزيز يقلل من الولوج إلى الذاكرة، في حين يحافظ على معدل نجاح المهام.
أيضاً، يتم تقديم نموذج متكامل للتعامل مع معالجة المصفوفات (GEMM) يركز على تمثيل مساحة الكود، مما يقضي على الضربات الزائدة من خلال التجميع المكاني وإعادة استخدام المراكز الزمنية. كما تمت مراعاة تصميم مسرع يدعم هذه التحسينات التي تتيح اختيار دقة دينامية وحسابات إعادة استخدام المراكز.
تشير نتائج التجارب إلى أن VQVLA يحقق فائدات كبيرة تصل إلى 6.5 ضعف، 2.8 ضعف، 1.9 ضعف، 3.3 ضعف، و4.3 ضعف مقارنةً بوحدات GPU مثل A100 وDadu-Corki وغيرها، مع تغيير ضئيل جداً في دقة النتائج.
إن الابتكارات التي يقدمها هذا الإطار تعكس إمكانيات غير محدودة لتحسين أداء النماذج المتكاملة، الأمر الذي يعزز قدرة الذكاء الاصطناعي على التفاعل بشكل فعال وسلس مع بيئته الحقيقية.
إطار متقدم لتسريع استدلال نماذج الذكاء الاصطناعي المتكاملة: تقنيات مبتكرة لزيادة الكفاءة
يكشف إطار VQVLA الجديد عن إمكانيات مذهلة لتحسين الأداء في نماذج الرؤية-اللغة-الإجراء (VLA)، مما يجعله خطوة حيوية لضمان نشر الذكاء الاصطناعي في الوقت الفعلي. هذه التقنيات الجديدة تتفوق في تسريع الاستدلال بينما تحافظ على دقة النتائج.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
