تُعتبر عملية تصنيع وتوليد الأصوات غير الكلامية (Nonverbal Vocalizations) جزءاً أساسياً لتطوير إدراك صوتي طبيعي وتعبيري، لكنها تواجه تحديات كبيرة بسبب التنوع الصوتي الواسع والافتقار للتوازن في التوزيع في قواعد البيانات الحالية. لمعالجة هذه التحديات، تم تطوير نظام DiTAR المدرك للأصوات غير الكلامية.

يقوم هذا النظام بنمذجة تخزين الكلام المستمر (continuous speech latents) ويقوم بترميز 16 فئة مستهدفة من الأصوات غير الكلامية كرموز مخصصة، كما يُكيف توقع التوقف لتمييز الأصوات المتوسطة من حدود الكلام. يبدأ التدريب بتدريب مسبق ثنائي اللغة على نطاق واسع على خطاب NVV المتنوع، تليه عمليات تحسين دقيقة باستخدام مجموعة بيانات معززة من خلال التحسين الاصطناعي المستهدف وإعادة التوازن وفقاً للتكرار.

وفي مرحلة الاستدلال، يتم اختيار التحفيز الصوتي، وضبط إرشادات نموذج اللغة (LM-guidance) ومقاييس حقن الضجيج، وكذلك تطبيق طريقة اختيار «الأفضل من بين» مع تحليل متعدّد المعايير لتقليل حالات الفشل في التوليد.

النظام النهائي حقق نتيجة متوازنة رسمياً قدرها 62.786، مما يجعله يكون في المرتبة الأولى في اللغة الصينية، والثانية في الإنجليزية، والأولى بشكل عام بين الأنظمة المشاركة في مسابقة NVVSpeech Challenge لعام 2026.

تشير الدراسات التي تركزت على التفكيك إلى أن التحسين المستهدف يعود بأكبر فائدة على الفئات الأقل تمثيلاً من الأصوات غير الكلامية، بينما يتطلب اختيار المرشحين القوي تحقيق توازن بين دقة NVV، وأمانة المعاجم، وجودة الإدراك.