في خطوة مبتكرة نحو تحويل كيفية فهمنا للحركات البشرية، تمّ تقديم أبحاث جديدة تبحث في وظيفة استنتاج الوضعيات الثلاثية الأبعاد (3D Poses) لعدة أشخاص من خلال إشارات صوتية فقط. هذه الدراسة التي تم نشرها في arXiv تحت عنوان **تقدير الوضعيات الثلاثية الأبعاد للعديد من الأشخاص باستخدام الصوت**، تشير إلى تقدم مهم في استغلال المعلومات الصوتية بشكل غير تقليدي.

تواجه عملية تقدير الوضعيات في حالة وجود عدة أشخاص العديد من التحديات، حيث يؤدي التداخل المعقد للإشارات الصوتية الناتجة عن حركات الأفراد إلى صعوبة في تفكيك التغيرات المتعلقة بحركة كل فرد على حدا. فوجود أكثر من شخص واحد يجعل من المعقد تحديد تأثير كل فرد علي الإشارة المسجلة. بالإضافة إلى ذلك، فإن الانعكاسات في البيئة تزيد من تعقيد الوضع، مما يؤدي إلى تأخيرات في الانتشار تُعقد من العلاقة الزمنية بين الحركة والإشارة الصوتية.

لتجاوز هذه التحديات، اقترح الباحثون **SoundMHPE** (تقدير الوضعيات البشرية المتعددة القائم على الصوت)، والذي يعد إطار عمل مبتكر يتكون من مكونين رئيسيين. أولًا، يقوم **Acoustic Multi-scale Encoder** بالتقاط ميزات زمنية وترددية متنوعة لتفكيك التوقيعات الصوتية الدقيقة من الإشارات المعقدة. أما المكون الثاني، **Temporal Pose Decoder**، فيستخدم آلية انتباه لفك تشابك المعلومات المرتبطة بالأشخاص عبر الإطارات الزمنية المتعاقبة، مما يسمح بإعادة بناء الوضعيات الفردية بدقة.

لإثبات فعالية هذا النموذج، أنشأ الفريق مجموعة بيانات (**AMP Dataset**) تصل مدتها إلى 6 ساعات، تحتوي على أكثر من 432,000 إطار متزامن من بيانات الوضعيات الصوتية. وأظهرت النتائج أن **SoundMHPE** يتفوق على النماذج الأساسية.

بهذا .................. أتساءل، كيف يمكن أن تغير هذه التقنية المستقبل؟ شاركونا آرائكم في التعليقات!