يشهد مجال الذكاء الاصطناعي تقدمًا ملحوظًا، خاصة عندما يتعلق الأمر بتكييف نماذج اللغة الذاتية (autoregressive language models) للتعامل مع إشارات متعددة الوسائط مثل الصور والأفعال. ومع ذلك، تكمن التحديات الرئيسية في تحويل الإشارات الحركية المستمرة إلى رموز رقمية، حيث تعتبر التشفير الفعال هو العنصر الأساسي لتحويل المدخلات عالية الأبعاد إلى رموز رقمية مدمجة لمعالجة الاستجابات.
تواجه المحولات الحالية عادةً مشكلة كبيرة تُعرف باسم "عنق الزجاجة في التشفير" (discretization bottleneck)، حيث لا تستطيع الاحتفاظ بالديناميات الدقيقة اللازمة للتحكم الدقيق، مما يحد من الأداء المحتمل لنماذج الرؤية واللغة والأفعال (Vision-Language-Action models).
لحل هذه المشكلة، تم تقديم تقنية $M^2$Tok، وهي طريقة تستخدم tokenizer متعدد الرؤوس و متعدد الكتابات، تم تصميمها لتقليل خطأ الاستنساخ وتحسين أداء السياسات. تتضمن هذه التقنية ابتكارين هيكليين رئيسيين:
1. **تفكيك الميزات الحركية الكامنة**: حيث تتيح التقنيات متعددة الرؤوس للموديل أن يرتبط ضمنيًا برؤوس محددة مع أبعاد أفعال مختلفة.
2. **تخصيص كتب مستقلة لكل رأس**: حيث تصبح عمليات التشفير أكثر تعبيرية، مما يؤدي إلى تقليل ملحوظ في خطأ الاستنساخ مقارنةً بالأساليب السابقة.
تم تقييم النموذج المبني على $M^2$Tok ضمن بيئات مثل RoboTwin و Simpler-Env وثلاث مهام حقيقية دون استخدام مسبق (zero-shot tasks). وقد أظهرت النتائج التجريبية أن طريقتنا لا تحقق فقط دقة استنساخ أعلى، بل تعزز أيضًا من معدل النجاح لنماذج VLA بشكل كبير. كما تؤكد الدراسات الداعمة فعالية الابتكارات متعددة الرؤوس وكتب التشفير المتعددة.
للاطلاع على الكود، يمكن زيارة رابط الكود على GitHub.
تحليل ثوري: $M^2$Tok لتحسين تحويل الأفعال في نماذج الرؤية واللغة
تقدم تقنية $M^2$Tok حلاً مبتكرًا لمشكلة تحويل الأفعال المستمرة إلى رموز رقمية، مما يعزز من أداء نماذج الرؤية واللغة. بدعم من الابتكارات البنائية الجديدة، تعيد هذه التقنية تعريف كيفية معالجة التفاعلات المعقدة بين الرؤية واللغة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
