إن التعرف على عواطف الكلام (Speech Emotion Recognition - SER) في اللغات ذات الموارد المحدودة يعتبر من التحديات التي يواجهها الباحثون. هذا الموضوع دفع فريقاً من العلماء لاستكشاف استخدام تقنية Whisper في معالجة الكلام الفارسي. تم التركيز بشكل خاص على تقنيات تقليل الأبعاد وتكييف النماذج اللغوية لتلبية احتياجات هذا المجال.
درس الباحثون إطاراً يعتمد على Whisper، حيث يستخرجون تمثيلات (embeddings) على مستوى الإطارات من مشغل Whisper، مع تقليل الأبعاد باستخدام تحليل المكونات الرئيسية (PCA). هذا النهج لا يحسن الأداء فحسب، بل يقلل أيضاً من عدد المعلمات القابلة للتدريب، ما يسهل عملية التعليم.
تمت إضافة آلية تجميع قائمة على الانتباه (attention-based pooling) لتجميع هذه التمثيلات قبل تصنيفها باستخدام رأس تنبؤ خفيف الوزن. وأظهرت التجارب على مجموعة بيانات شيمو (ShEMO) أن تقنية تقليل الأبعاد باستخدام PCA كانت فعالة في تحسين أداء التعرف على العواطف، مع تقليل زمن التدريب واستخدام الذاكرة.
على الرغم من أن تحسين Whisper على مهمة التعرف التلقائي على الكلام (Automatic Speech Recognition - ASR) أدى إلى تحسينات بسيطة في أداء التعرف على العواطف، إلا أن النتائج تشير إلى أن التكيف اللغوي لا ينتج عنه تحسينات كبيرة فيما يتعلق بالتمثيلات المرتبطة بالعواطف في الظروف التي تم تقييمها.
توفير هذه الدراسة رؤى عملية حول الاستخدام الفعال للنماذج الكبيرة المدربة مسبقاً للتعرف على العواطف في اللغات ذات الموارد المنخفضة، وهو ما يمثل خطوة مهمة نحو تحسين تقنيات التعرف على الكلام.
استخدام تقنية Whisper في التعرف على عواطف الكلام الفارسي: دراسة مثيرة حول تحسين الأداء!
تعرفوا على كيف يمكن لتقنية Whisper أن تحسن من التعرف على عواطف الكلام في اللغة الفارسية. الدراسة تسلط الضوء على تقنيات تقليل الأبعاد وفعالية التكيف مع النماذج اللغوية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
