تتوجه الأبحاث الحديثة في مجال المعالجة الصوتية إلى إيجاد توازن بين جودة الصوت وكفاءة النموذج. نموذج جرين سبيتش (GrainSpeech) يمثل خطوة كبيرة في هذا الاتجاه، حيث قدم نتائج واعدة بفعل تصميمه الفريد الذي يقلل الحاجة للسياق ويزيد من دقة التفاصيل الصوتية.

في هذا النموذج، درس الباحثون تأثيرين رئيسيين: سياق جهاز التشفير (encoder context) وإشراف لاستخدام طيف ميل (Mel-spectrogram supervision). أظهرت دراساتهم أنه عند توسيع مجال الانتباه الذاتي (self-attention) لما يتجاوز 15 فونيم، لا يتم تحقيق أي تحسينات ملحوظة في توقعات النغمة (pitch)، الطاقة (energy)، أو مدة الصوت (duration). بناءً على هذه النتائج، قاموا بتقديم جهاز تشفير يعتمد على مجالات استجابة ثابتة، مما ساهم في تقليل الأخطاء في التوقعات بنسبة 36.0% و17.3% و3.4% على التوالي.

أظهرت الأبحاث كذلك أن نقل إشراف تباين التدرجات من مجال الصور يؤدي إلى استعادة التباينات الدقيقة ولكنه قد يقود إلى تدهور جودة التوقعات. ولذا تم تطوير صيغة خاصة بطيف الميل تجمع بين التدرجات الخاصة بالمحاور والإحصائيات المحلية المتداخلة، مما أعطى نتائج أفضل.

على الرغم من احتوائه على 264.8K فقط من المعلمات، استطاع جرين سبيتش (GrainSpeech) تحقيق أداء يتجاوز 17.9x من الزمن الحقيقي على وحدات التحكم الدقيقة (MCU)، مع تعزيز الدرجات (UTMOS) لتكون قريبة جدًا من نماذج أكبر بكثير تحتوي على أكثر من 1.5% من معلماتها فقط.

يمكن للمهتمين التجربة والتفاعل مع النموذج عبر الكود المصدري والعروض المتاحة على GitHub. ما رأيكم في هذا التطور؟ شاركونا في التعليقات!