في عالم الذكاء الاصطناعي، تتطلب النماذج التي تربط بين الرؤية واللغة والفعل (VLA) استراتيجيات متقدمة تتجاوز مجرد توقع الأفعال. فالنجاح في المهام طويل الأمد يتطلب التنسيق بين الإدراك، التخطيط، التنفيذ، والتحقق من التقدم. هنا يأتي دور إمبوضيد سكيلز (EmbodiedSkillsالإطار الجديد الذي يعيد تعريف كيفية تنفيذ الوكلاء للمهام.

تعتبر EmbodiedSkills بمثابة إطار موحد حيث تُعامل كل قرار مهاري كاقتراح تنفيذي. هذا يعني أن النظام يتحقق من الشروط اللازمة قبل تنفيذ أي عملية، ويتأكد من نتائج التنفيذ بعد ذلك. مما يجعلها تضفي طابعًا استشرافيًا على الإجراءات المتخذة.

تتصل واجهة المهارة القابلة للتنفيذ ذات المستوى العالي بالاختيار العالي للمهارات، وتنفيذ VLA ذو المستوى المنخفض، والتحقق من النتيجة داخل دورة عميل واحدة. وبفضل ثبات هذه الواجهة، يمكن استبدال سياسات VLA ذات المستوى المنخفض أو تعديلها دون الحاجة لتغيير الدورة العاملة للعميل.

تم اختبار إطار EmbodiedSkills مع نموذج Qwen3-VL ونموذج OpenPI/pi0.5 على منصات RoboTwin 2.0 وLIBERO. وقد أظهرت السياسات المعدلة نجاحًا متوسطًا يصل إلى 86.20% عبر 50 مهمة على RoboTwin 2.0، و97.40% عبر أربع مجموعات من LIBERO. يؤكد هذا الأداء على فعالية السياسات المتبعة في إطار EmbodiedSkills.

ومع استمرار تطور التقنيات في هذا المجال، يوفر هذا الإطار طبقة وكيل يمكن تدريبها وفحصها لتحويل هذه السياسات إلى أنظمة مغلقة الدورة، مما يسهل معالجة واستجابة الوكلاء للتغييرات في بيئاتهم.

هل أنتم متحمسون لرؤية كيف ستحول EmbodiedSkills مستقبل الروبوتات وتفاعلها مع العالم؟ شاركونا آرائكم في التعليقات!