تشهد مجالات الذكاء الاصطناعي (AI) والتفاعل بين البشر والكائنات (Human-Object Interaction) تطوراً ملحوظاً، حيث تم تقديم مفهوم جديد يعرف بـ "توصيف حركة التفاعل المتسند إلى الهوية". تعد هذه التقنية الجديدة تكملة للطرق التقليدية التي كانت تستخدم مصطلحات عامة مثل "شخص ما" أو "إنسان" في وصف أنماط الحركة.

ومع التقنيات السابقة، كانت النتائج تفتقر إلى الدقة بسبب غياب التركيز على هوية الفرد، مما يجعل من الصعب تمييز إنسانٍ عن آخر. لكن الآن، مع عرض المهمة الجديدة المسماة "Identity-Aware Human-Object Interaction Motion Captioning"، يمكن لكل وصف للحركة أن يتمحور حول هوية المتفاعل.

يمكن للتقنية الجديدة أن تولد وصفاً مثل "Sub_ID يرفع الكرسي" بدلاً من استخدام تعبيرات غير محددة. تم تصميم هذه المهمة اعتماداً على مجموعتي بيانات BEHAVE وInterCap، وتم تقديم نموذج مبتكر يعرف باسم ID-HOINet.

يتمتع ID-HOINet بمكونين رئيسيين هما "وحدة تعلم الحركة المتعددة الزوايا" (Multi-View Identity-Motion Learning Module) واستراتيجية إعادة كتابة الوصف على مرحلتين (Two-Stage Caption Rewriting Strategy). حيث تتعلم الوحدة الأولى من الفيديوهات المتعددة الزوايا عن طريق نمذجة الاعتماد عبر مراحل زمنية متعددة ووجهات نظر كاميرية، مما يسمح بالتقاط ملامح الهوية وحركة التفاعل بدقة.

وفي مرحلة الاستنتاج، تقوم استراتيجية إعادة الكتابة بجلب هوية الشخص وتوليد أوصاف حركة تفاعلية غير متعلقة بالهوية، لتعيد كتابة هذه الأوصاف مع الهوية المتوقعة، مما ينتج عنه وصف حركة تفاعلية معتمد على الهوية.

تُظهر التجارب أن ID-HOINet يحقق أداءً رائداً في مجاله، مما يفتح آفاقاً جديدة للبحث والتطبيقات العملية. من المتوقع أن يتم إصدار الشيفرة المصدرية عند قبول الورقة البحثية.