في خطوة مثيرة لدعم التعرف التلقائي على الكلام (Automatic Speech Recognition - ASR) بلغة النيبالية، أجرى باحثون دراسة مقارنة بين ستة نماذج مدربة مسبقاً. تتضمن النماذج التي تم تحليلها: XLSR-53، IndicWav2Vec، MMS-1B، Whisper-Medium، Whisper-Large-v3-Turbo، وConformer-Hi، والتي تم تقييمها تحت بروتوكول موحد لتحسين الأداء.
استخدم الباحثون مجموعة بيانات نيبالية من OpenSLR SLR54، والتي تضم نحو 165 ساعة من الكلام، وتمت عملية النموذج بأيدي فنية باستخدام طرق معالجة متشابهة ومعدلات تعلم متطابقة. كانت النتائج مثيرة بالفعل؛ إذ حصل نموذج Whisper-Large-v3-Turbo على معدل خطأ في الكلمات (Word Error Rate - WER) بلغ 14.76%، بينما حقق نموذج IndicWav2Vec معدل WER يبلغ 14.89%. ما يثير الاستغراب هو الفجوة الكبيرة في عدد المعلمات وإجمالي البيانات التي تم تدريب النماذج عليها، حيث كان هناك فرق يصل إلى 9 مرات في عدد المعلمات و40 مرة في بيانات التدريب.
تظهر الدراسة أيضاً أن فك شيفرات CTC يمكن أن يعمل بسرعة تصل إلى 29 مرة أسرع من تقنية Whisper التلقائية دون فقدان الدقة، مما يؤثر على كيفية تفضيل استخدام هذه الأنظمة في التطبيقات العملية استناداً إلى متطلبات التأخير الزمني. كما أظهرت النتائج أن نموذج MMS-1B، أحد النماذج التي تعتمد على التحضير الضخم للغات، يقدم أقل تدهور على مجموعة بيانات FLEURS خارج نطاق الميدان – مما يشير إلى أن الحجم لا يزيد فقط من المتانة مقارنة بالدقة القصوى في المجال.
تعتبر هذه المقارنات معياراً جديداً لتقدير الأداء والكفاءة لنماذج التعرف على الكلام بلغة النيبالية، مما يمهد الطريق لتطوير هذه التكنولوجيا الهامة في المستقبل. لقد أثبتت الدراسة أن الاقتراب من العائلة اللغوية أثناء التدريب يمكن أن يكون له تأثير كبير على الأداء، مما قد يؤدي إلى نتائج أفضل من مساحة بيانات أضخم.
ما رأيكم في هذه التطورات المثيرة؟ شاركونا آراءكم في التعليقات!
تحليل مقارن لنماذج اللغة المتعددة من أجل التعرف التلقائي على الكلام بلغة النيبالية: اكتشافات مذهلة!
يستعرض هذا المقال مقارنة بين نماذج اللغة المتعددة المعتمدة مسبقاً لتعزيز التعرف التلقائي على الكلام بلغة النيبالية، مقدماً نتائج مدهشة تؤكد قوة الاقتراب من العائلة اللغوية بدلاً من حجم البيانات. كيف يمكن أن تغير هذه الاكتشافات مستقبل الذكاء الاصطناعي في نيبال؟
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←# نموذج Whisper# التعرف التلقائي على الكلام# الذكاء الاصطناعي# النماذج المدربة مسبقاً# البحث بلغة النيبالية
جاري تحميل التفاعلات...
