يمثل تعزيز الكلام جزءًا أساسيًا من تقنيات التعرف على الكلام (ASR)، إلا أن النماذج الحالية، التي تستخدم وحدات زمنية متكررة وعرضية، تعاني من محدودية الكفاءة. لذا، قدم الباحثون نظامًا مبتكرًا يقوم بمزج الزمن مع الأبعاد بطريقة أكثر فعالية. النظام الجديد، الذي يعتمد على بلوك ممازجة الزمن والأبعاد (Parallel Time-Band Mixer - PTBM)، يمكّن من تحسين درجة معالجة الكلام بطريقة تضمن نمذجة السياق بكفاءة عبر الزمن والتردد.

يتضمن PTBM مزيجًا زمنيًا داخل النطاق وتركيزًا عرضيًا لكل إطار في هيكل موحد، مما يعزز من فعالية النموذج بشكل كبير. بالإضافة إلى ذلك، تم إدخال تقنية جديدة تُعرف بإضافة المراقبة المتعلمة (Learned Observation-Adding - LOA) التي تهدف إلى تقليل العوامل المزعجة ذات الحساسية العالية لعمليات التعرف على الكلام، دون الحاجة إلى ضبط بيانات التطوير.

أظهرت التجارب التي أجريت اعتمادًا على تحدي DNS وCHiME-4، بمساعدة نماذج Whisper الخلفية المجمدة، أن النظام الجديد يقلل بشكل ثابت من معدل الأخطاء في الكلمات مقارنة بنماذج الانقسام العرضي المتكررة، مع استخدام عدد قليل للغاية من المعلمات (0.96 مليون) وموارد حسابية منخفضة (0.58 GMAC/s) لشبكة الواجهة الأمامية.

هذا الابتكار يعتبر خطوةdtype نوعية في مجال هيكلة بيانات الصوت، مما يفتح الطريق أمام تحسينات أكبر لتطبيقات التعرف على الكلام في المستقبل.