نموذج الرؤية-اللغة-الإجراءات (VLA) هو من الابتكارات الأكثر تقدماً في مجالات الذكاء الاصطناعي، حيث يظهر قدرة كبيرة على الفهم الدلالي. لكن، هل تساءلت يومًا لماذا يحدث الفشل احيانًا أثناء استخدام هذه النماذج؟ هذه الدراسة الجديدة تسلط الضوء على هذا الجانب الحساس.

فشل هذه النماذج هو ظاهرة شائعة، والتنبيه بدلاً من تحسين الأداء عن طريق إعادة التدريب يمكن أن يكون حلاً معقداً وموارد مكلف. هنا يأتي دور إطار العمل الجديد المسمي CorrectVLA. هذا الإطار يساهم في تصحيح الأخطاء عبر تحويل التصحيحات اللغوية الطبيعية لمهمة معينة إلى تعديلات بسيطة على شدة الإجراءات، من دون الحاجة لتغيير أوزان السياسة.

تقوم الفكرة على تفاعل إنساني بسيط يتمثل في توفير تصحيح واحد فقط على مستوى المهمة، والذي يمكن تطبيقه على جميع المحاولات بدون الحاجة للتدخل في كل مرة. في تجارب محاكاة، تمكن CorrectVLA من استعادة الأداء الفائق في مواجهة الفشل في المحاكاة وفقًا للبيانات المستهدفة وغير المستهدفة.

عند استخدام روبوت حقيقي من طراز UFactory xArm7 تحت تأثيرات البيئة المتغيرة، ثبت أن CorrectVLA قادراً على إعادة تحقيق النجاح تقريباً بالشكل المثالي عندما تفشل السياسات الأساسية، مما يدل على قدرة عامة قوية على التكيف.

أظهرت الدراسة تصنيفًا لأشكال الفشل على LIBERO-90، حيث تبين أن فشل المحاذاة التنفيذية، والذي يحدث عندما تصل السياسة إلى الهدف الصحيح ولكن بخطأ في حجم الإجراء، هو جزء قابل للتصحيح. بينما الأشكال الأخرى من الفشل التي تكسر الفهم الدلالي لا يمكن معالجتها بواسطة هذا الأسلوب.

تثبت هذه المقالة أن النهج ينحج عندما تكون السياسات صحيحة استراتيجياً، بينما يفشل عندما يكون الفهم الأساسي غائباً. مما يفسر الحدود العملية لتصحيح الأداء أثناء التنفيذ. وبالتالي، يمكن اعتبار هذه الخطوة علامة بارزة نحو تحسين أداء نماذج الرؤية-اللغة-الإجراءات.

ما رأيكم في هذا التطور؟ شاركونا في التعليقات.