في عالم الذكاء الاصطناعي، يُعتبر فهم حركات الإنسان وتفاعلاته مع البيئة من القضايا المعقدة التي تحظى باهتمام الباحثين. وفي هذا السياق، تم تقديم نموذج PACT (End-to-End Learning of Human Pose, Contacts, and Forces from Video) كحل مبتكر يجمع بين تقدير الوضعيات البشرية وتفاعلات القوى في نموذج واحد شامل.

يعتمد نموذج PACT على فكرة بسيطة ولكن فعالة: لماذا نفصل بين تقدير وضعيات الجسم وتقدير القوى الناتجة عن التفاعلات، بينما يمكننا دمجها؟ يقدم هذا النموذج تقنية تعلم متكاملة تسمح بتقدير الوضعيات، والاتصالات، والقوى الناتجة عن التفاعل مع العالم الخارجي باستخدام فيديو أحادي العين (Monocular Video).

ما يميز PACT هو أنه يعتمد على نموذج أساسي لإعادة بناء الإنسان يتمتع بقدرة على التعلم من خلال رموز قوى التماس (Contact-Force Tokens) وTransformer زمني (Temporal Transformer) يجمع بين ميزات الفضاء المرئي وحركة العالم. من خلال الرؤوس التنبؤية المشتركة، يتم تحسين تقديرات وضعيات الإنسان وتوقعات التفاعلات الفيزيائية، مما يعزز دقة النتائج.

ولمعالجة النقص في بيانات القوى المعلنة، قام الباحثون بتطوير خط أنابيب لت Annotate البيانات يجمع بين تصنيف التماس وتحسين الحركة والقوى بناءً على الفيزياء، مما ينتج عنه إشراف تدريبي مستند إلى بيانات حقيقية وصناعية.

وتم تقديم معيار جديد للقياس في العالم الحقيقي يسمى ForceWall، والذي يتضمن مقاطع فيديو لتسلق الجبال وقوى اتصال حقيقية تم الحصول عليها من أجهزة استشعار القوة.

أظهرت التجارب أن نموذج PACT يتفوق على الأساليب التقليدية في تقدير الاتصال والقوى، مما يعزز من فعالية التعلم المتكامل في استعادة الحركات البشرية والتفاعلات الفيزيائية من الفيديو.

هل تعتقد أن هذا النوع من البحث يمكن أن يغير مستقبل الروبوتات؟ شاركونا آراءكم في التعليقات!