في عالم الذكاء الاصطناعي، تزداد أهمية استخدام الصوت كوسيلة لتعرف الأنشطة البشرية (HAR) بشكل ملحوظ. فالصوت لديه القدرة على التقاط تفاعلات الأجسام والأحداث البيئية والإشارات السياقية في البيئات اليومية، مما يجعله أداة مثالية في هذا المجال. ومع أن الصوت عالي الدقة (HR) يقدم معلومات غنية تساعد في تطوير النماذج، إلا أنه يأتي بتكاليف كبيرة من حيث الطاقة والتخزين، بالإضافة إلى إمكانية تعرض المحتوى الصوتي الحساس للخطر.

لذلك، يظهر الصوت منخفض الدقة (LR) كخيار أكثر حفاظاً على الخصوصية وكفاءة في استخدام الموارد. ومع ذلك، يؤدي تقليل معدلات العينة إلى فقدان بعض الإشارات الصوتية الأساسية اللازمة لتعرف الأنشطة، مما يؤدي إلى تدهور واسع في الأداء. لذا، طرح الباحثون مفهوم التعلم المدعم بالخصوصية وفق دقة الحساسات، حيث يتوفر الصوت عالي الدقة خلال التدريب، بينما يعتمد الاستدلال على الصوت منخفض الدقة فقط.

قدم الباحثون في هذا الصدد مشروع RAST، وهو إطار نقل واعٍ للدقة يقوم بضغط تمثيلات المعلم عالي الدقة مع الحفاظ على المعلومات على مستوى الرموز وهيكل الجوار. وبفضل تلك التقنية، يتم إجراء ضبط محلي بين الصوت عالي الدقة ومنخفض الدقة. وقد أظهرت التجارب على مجموعتي بيانات SAMoSA وAudioIMU أن RAST يتفوق باستمرار على تقنيات التدريب باستخدام الصوت منخفض الدقة فقط، مما ساعد في تحسين التعرف على الصوت منخفض الدقة بنسبة تصل إلى 7.8%!

يمثل هذا الابتكار خطوة كبيرة نحو تحقيق دقة عالية في تمييز الأنشطة دون التخلي عن الخصوصية أو كفاءة الموارد. ما رأيكم في هذا التطور؟ شاركونا في التعليقات!