في عالم الذكاء الاصطناعي المتطور، تُعَدّ القدرة على فهم وتوليد الحركة واللغة بشكل موحد إحدى أهم التحديات التي تواجه الباحثين. ومن هنا جاءت مبادرة فريق البحث لإطلاق نموذج "Open-UniMo" الذي يمثل خطوة متقدمة نحو تحقيق هذا الهدف. يُعتبر هذا النموذج جزءًا من جهود كبيرة تهدف إلى تمكين أنظمة الذكاء الاصطناعي المتمثلة في نماذج اللغة الكبيرة (Large Language Models) من إدراك الحركة بشكل متزامن مع معالجة النصوص، مما يتيح لها فهم وتوليد الحركات البشرية في بيئات مفتوحة.

يختلف Open-UniMo عن النماذج الحالية التي غالبًا ما تعالج الحركة كعنصر مكمل فقط للنصوص. بدلاً من ذلك، يجمع هذا النموذج بين بيانات الحركة والنصوص في بيئة موحدة من خلال توسيع المفردات لتشمل 64,000 رمز حركي بجانب 150,000 رمز نصي، وهو ما يُتيح تفاعلاً متكاملًا بين الشكلين.

يُعتمد أيضًا على منهجية جديدة تُسمى "Chain-of-Thought reasoning" التي تعمل كجسر لتوحيد ديناميات الحركة وسمات اللغة. هذا المنهج يُحسن من المخرجات النهائية ويقلل من الأخطاء الناتجة عن التنبؤ التلقائي.

تم تدريب Open-UniMo بنظام مزدوج المرحلة، حيث يعتمد على تحسين دقيق بإشراف لتحسين التوافق الدلالي، مما يجعل النموذج أكثر فعالية في تمثيل الحركة والنصوص.

لتقييم فعالية Open-UniMo، تم تطوير معيار جديد يُسمى "Open-MoBench" الذي يختبر قدرات النموذج على توليد الحركة من النص وفهم النص من الحركة، مما يوفر منصة شاملة للاختبارات.

تظهر النتائج التجريبية أن Open-UniMo يحقق أداءً رائدًا مقارنةً بالمعايير التقليدية، مما يُثبت أن النموذج يمثل تحولًا مثيرًا في مجال الذكاء الاصطناعي. مع هذا التطور، يمكننا أن نتوقع المزيد من الابتكارات في طريقة تعامل أنظمة الذكاء الاصطناعي مع التحركات البشرية في المستقبل.

ما رأيكم في هذا التطور؟ شاركونا في التعليقات.