في عالم الذكاء الاصطناعي، يشهد تطوير تقنيات تحويل النص إلى صوت (Text-to-Speech) تطورات مثيرة، وبشكل خاص عند استخدام نماذج التعلم العميق. أحدث الأبحاث في هذا المجال توصلت إلى ابتكار نموذج جديد خاص باللغة التايلاندية يدعى Wayu-Paxa-TTS-Edge.

تتميز هذه التقنية بتقديم طريقة مبتكرة للتغلب على قيود استخدام نماذج الصوت التقليدية التي تتطلب إما بيانات كثيرة من مراجع صوتية محددة أو نماذج ضخمة مكلفة إدراكيًا. يتبنى هذا النموذج تقنية جديدة تستخدم نموذج الصوت المتقدم كمرجع قابل للبرمجة، حيث يمكن تحويل مقاطع صوتية قصيرة لا تتجاوز 15 ثانية إلى نظام صوتي ثابت بالكامل مدرب على الكلام الاصطناعي.

تواجه اللغة التايلاندية تحديات فريدة في معالجتها، مثل عدم وضوح حدود الكلمات والنغمة اللفظية والأسماء والكلمات المستعارة، إضافةً إلى التعامل مع مفردات تشتمل على تحويلات من اللغة الإنجليزية إلى التايلاندية. على الرغم من هذه التحديات، أظهرت النتائج التفوق الملحوظ لهذا النظام الجديد، حيث حقق 68.2% في دقة الكلمات التحدي، و91.4% دقة في وضع التوقفات، متفوقًا على معلماته السابقة. كما أذعن النظام لأدنى معدل أخطاء في وضع التوقفات ضمن أنظمة مشابهة، حيث حقق 3.7% و1.1% من أخطاء كلمة إلى كلمة باللغتين التايلاندية والإنجليزية على التوالي.

من خلال توفير هذا النموذج وتأطير التقييم، نضع الأساس لتطوير تقنيات تحويل النص إلى صوت في اللغات ذات الموارد المحدودة. فهل أنتم مستعدون لاستكشاف المزيد عن مستقبل التكنولوجيا الصوتية؟ شاركونا آرائكم في التعليقات.