تتميز مرحلة الطفولة بتنوع أساليب التعبير، ولكن التعرف على الأصوات في كلمات الأطفال كان تحدياً كبيراً لفترة طويلة، وذلك بسبب ندرة بيانات التدريب والخصائص الفريدة لأصواتهم. لكن، في سياق مسابقة للتعرف على الأصوات، حقق فريق البحث إنجازًا مثيرًا من خلال تطوير نموذج خفيف الوزن يتجاوز التوقعات.
هذا النموذج، الذي يتألف من 94 مليون معلمة (parameter)، استطاع أن يتجاوز نماذج مثل WavLM Large التي تحتوي على 317 مليون معلمة، محققاً دقة قريبة من 0.04 CER عند مقارنته مع فرق المنافسة التي تعتمد على نماذج تشتمل على نحو 90 ضعف هذه المعلمات.
الإنجاز الأبرز تمثل في تطوير تطبيق PhonemeTrainer، الذي يمكن تشغيله على معظم الهواتف الذكية الحديثة. يهدف هذا التطبيق إلى تحسين التعرف التلقائي على الكلام (ASR) والمساعدة في تحسين النطق لدى الأطفال، مما يسهل عليهم التعلم بطرق مريحة وفعّالة.
يتميز هذا الحل بتقنيات المعالجة على حافة الشبكة (edge processing)، مما يضمن حماية الخصوصية والامتثال لمتطلبات الأمان. إذن، كيف سيساهم هذا النموذج في تطوير أدوات تعليمية أفضل للأطفال؟
ثورة جديدة في التعرف على الأصوات: نموذج حديث لكلمات الأطفال يحطم الأرقام القياسية!
في تقدم غير مسبوق، تمكّن فريق البحث من تطوير نموذج فعّال للتعرف على الأصوات في كلمات الأطفال، يتفوق على نماذج كبيرة أخرى بنسبة ملحوظة. التطبيق الجديد يعمل على الهواتف الذكية، مما يسهل تحسين فهم اللغة لدى الأطفال.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
