في عالم الذكاء الاصطناعي، يتزايد الاهتمام بالنماذج التي تجمع بين الرؤية واللغة والعمل. حول هذه الفكرة، تمثل الأفعال جزءاً أساسياً، إذ تصف ليس فقط النتائج الفيزيائية للأفعال، ولكن أيضاً كيف تُؤدى هذه الأفعال. ومع ذلك، فإن التمثيلات الحالية للأفعال في نماذج الرؤية واللغة والعمل (Vision-Language-Action Models) تُحسّن عادةً من خلال تقنيات إعادة الإعمار دون الأخذ بعين الاعتبار الفروق اللغوية الدقيقة.
من خلال نموذج BridgeV2، يتضح أن مسارات الأفعال لا تحتوي فقط على معلومات مرتبطة بالأفعال من خلال تغيرات الحالة البصرية، بل تعتبر أيضاً مصدراً غنياً للمعلومات اللغوية. لكن، كما أُظهر، فإن تقنيات إعادة الإعمار وحدها يمكن أن تؤدي إلى فقدان هذه المعلومات القيمة.
وللمعالجة، تم تقديم نماذج SALT - مُعالج الأفعال المتوافق مع الدلالات (Semantically ALigned action Tokenizer)، الذي يحسن من عملية تحويل الأفعال إلى تمثيلات رقمية باستخدام أهداف مساعدة تتطلب من نموذج الرؤية واللغة الثابت استعادة التعليمات من الأفعال المُكمّمة.
النماذج التي تم تدريبها باستخدام SALT أظهرت نسبة نجاح متوسط تصل إلى 71.9% في بيئة SimplerEnv، مقابل 42.7% لنموذج VQ-VAE المرتكز فقط على إعادة الإعمار، و31.2% لنموذج FAST. بفضل SALT، يمكن تطوير رموز متخصصة للأفعال مع الحفاظ على دقة إعادة الإعمار. تظهر هذه النتائج أن مسارات الأفعال للروبوتات تقدم مصدراً رئيسياً لتثبيت المعلومات اللغوية، وأن الحفاظ على هذه البنية في تمثيلات الأفعال يمكن أن يحسن بشكل كبير من السيطرة المشروطة بالغة.
ثورة في نماذج الذكاء الاصطناعي: كيف تتوافق تمثيلات الأفعال مع اللغة في نماذج الرؤية واللغة والعمل؟
تقدم الأبحاث الحديثة رؤى جديدة حول كيفية تحسين التفاعل بين تمثيلات الأفعال واللغة في نماذج الرؤية واللغة. النموذج الجديد SALT أظهر تحسينات ملحوظة في أداء الروبوتات بنسبة تصل إلى 71.9%.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
