في تطور جديد ومثير في عالم تكنولوجيا الذكاء الاصطناعي، أُعلن عن نظام التعرف على الكلام اليوناني-الإنجليزي، المعروف باسم سويبا (Sophea). هذا النظام يمثل نتيجة لبرنامج هندسي معقد استمر لعدة أشهر، حيث أُجري تقييم شامل يتضمن تسع مراحل إنتاجية بهدف تقييم أداء النظام في تحديد درجات الخطأ في الكلمات، والتعرف على اللغات، ومدى جودة الصوت في بيئات صاخبة.

عبر 23 دورة تدريبية واثنان من بنى النماذج، لم تتمكن أي تركيب بيانات تدريب من النجاح في جميع المراحل التسع في الوقت نفسه. كان الوصول الى الهدف المنشود للكلمات في بيئة صاخبة يتطلب نحو 1500 خطوة من التعرض الكثيف، بينما تفعيل التعرف على اللغة الإنجليزية استغرق حوالي 250 خطوة.

تم تصميم نظام سويبا من خلال خط بيانات مُعّدة بالتدريج، حيث استطاعت عملية التدقيق لمستوى جودة الصوت أن تُقلل نسبة التسجيلات المُهملة من 98.7% إلى 10.6%. بينما تم عزل عيب معين يتعلق بالهلاوس الصوتية إلى حزمة واحدة من بيانات التدريب.

وساهم استخدام تقنيات التحليل المُعتمدة على النماذج كـ ROVER في زيادة نسبة النجاح في المراحل من 4 إلى 9 من أصل 9، مما أدى إلى تحسين أداء النظام في تقليل نسبة الأخطاء عند التداخل بين الأطراف المختلفة.

ومع ذلك، لم يتم الإفراج عن أوزان النماذج أو بيانات التدريب، بل تم تقديم منهجيات ونتائج كمية فقط. نأمل أن يرى هذا الابتكار النور في المستقبل، مما يعزز تجربة المستخدمين في التفاعل مع التقنيات الصوتية.

هل أنتم متحمسون لتطورات الذكاء الاصطناعي في مجال التعرف على الكلام؟ شاركونا آراءكم وأفكاركم في التعليقات!