أصبح فهم الحركة في الفيديوهات جزءًا حيويًا من التطبيقات التفاعلية، كالروبوتات والتنقل الذاتي. ومن المعروف أن نماذج اللغة الكبيرة (Large Language Models) عادة ما تعالج الفيديوهات من خلال عينات متفرقة مما قد يتسبب في فقدان بعض التفاصيل الهامة حول الحركة والتفاعلات. ولهذا، تم تقديم تقنية Motion-as-Prompt (MaP) كإطار عمل جديد بقيادة حركات الفيديو.

تعتبر MaP تقنية فريدة حيث تتيح استعادة مسارات النقاط الكثيفة، واختيار الإطارات الغنية بالمعلومات حول الحركة، ثم توضح هذه المسارات على مدخلات بصرية، مما يساعد نماذج اللغة على إدراك التغيرات الخفية في الاتجاهات والتفاعلات. النتائج التجريبية على مجموعات بيانات مثل CLEVRER وSomething-Something-v2 أظهرت أن هذه التقنية قد حسنت دقة الفهم الحركي بمعدل 4.2% و8.9% لنموذج GPT-5.5 على التوالي.

الأمر المثير هو أن هذه التحسينات تمت دون التأثير على فهم الجوانب غير الحركية، مما يبرز قوة تقنية MaP ومرونتها. يعد هذا الابتكار خطوة كبيرة نحو تحسين الفهم الحركي في نماذج الذكاء الاصطناعي، مما يفتح آفاقاً جديدة للتطبيقات المستقبلية.

إذا كنتم مهتمين بالتفاصيل الكاملة حول هذه التقنية الرائدة، يمكنكم زيارة مشروع MaP. ما رأيكم في هذا التطور؟ شاركونا آراءكم في التعليقات!