يمثل تعزيز الكلام جزءًا أساسيًا من تقنيات التعرف على الكلام (ASR)، إلا أن النماذج الحالية، التي تستخدم وحدات زمنية متكررة وعرضية، تعاني من محدودية الكفاءة. لذا، قدم الباحثون نظامًا مبتكرًا يقوم بمزج الزمن مع الأبعاد بطريقة أكثر فعالية. النظام الجديد، الذي يعتمد على بلوك ممازجة الزمن والأبعاد (Parallel Time-Band Mixer - PTBM)، يمكّن من تحسين درجة معالجة الكلام بطريقة تضمن نمذجة السياق بكفاءة عبر الزمن والتردد.
يتضمن PTBM مزيجًا زمنيًا داخل النطاق وتركيزًا عرضيًا لكل إطار في هيكل موحد، مما يعزز من فعالية النموذج بشكل كبير. بالإضافة إلى ذلك، تم إدخال تقنية جديدة تُعرف بإضافة المراقبة المتعلمة (Learned Observation-Adding - LOA) التي تهدف إلى تقليل العوامل المزعجة ذات الحساسية العالية لعمليات التعرف على الكلام، دون الحاجة إلى ضبط بيانات التطوير.
أظهرت التجارب التي أجريت اعتمادًا على تحدي DNS وCHiME-4، بمساعدة نماذج Whisper الخلفية المجمدة، أن النظام الجديد يقلل بشكل ثابت من معدل الأخطاء في الكلمات مقارنة بنماذج الانقسام العرضي المتكررة، مع استخدام عدد قليل للغاية من المعلمات (0.96 مليون) وموارد حسابية منخفضة (0.58 GMAC/s) لشبكة الواجهة الأمامية.
هذا الابتكار يعتبر خطوةdtype نوعية في مجال هيكلة بيانات الصوت، مما يفتح الطريق أمام تحسينات أكبر لتطبيقات التعرف على الكلام في المستقبل.
ابتكار ثوري في تعزيز الكلام: مزج الزمن مع الأبعاد لتحسين دقة تقنيات التعرف على الكلام!
حقق باحثون تقدمًا ملحوظًا في تحسين تقنيات التعرف على الكلام، من خلال تطوير نموذج متقدم لمزج الزمن والأبعاد. التقنية الجديدة تعد ثورة في مجال معالجة الصوت وستمثل قفزة نوعية في صناعة الذكاء الاصطناعي.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
