في عصر التكنولوجيا السريعة والمتطورة، أصبح التعرف التلقائي على الصوت (ASR) جزءاً أساسياً من تجارب المستخدمين. مع تنامي الاعتماد على تقنيات الصوت في التطبيقات اليومية، أصبح من الضروري تطوير أنظمة لا تقتصر فقط على دقة النسخ، بل تقدم أيضًا استجابة سريعة للمستخدمين.

انطلقنا من خلال مبتكر GRPO الذي ينسجم مع تقنيات التعرف على الصوت التلقائي المبتكرة، حيث يعالج هذا النموذج التحديات المرتبطة بتأخير نقل الصوت عبر نموذج التشفير المتأخر (Delayed Streams Modeling - DSM). إن $ au$، وهو التحدي الرئيسي في تسريع استجابة النموذج، لم يعد يمثل الحد المفضل لتجربة المستخدم، مما يستدعي الابتكار.

بدلاً من استخدام نموذج تقليدي، نقدم مقياساً جديداً يسمى AWED، والذي يعكس التأخير على مستوى كل كلمة بدلاً من التأخير المعماري. بعد مرحلة ما بعد التدريب على النموذج، تم دمجه مع نموذج المكافآت من خلال GRPO، مما يرفع من مستوى أداء التعرف على الصوت بنسبة 30.8% عند تأخير هيكلي يعادل 80 مللي ثانية و5.7% عند 480 مللي ثانية. هذا يعني أن المستخدمين يمكنهم الآن الحصول على نصوص دقيقة بشكل أسرع، مما يتحسن تجربة الاستخدام بشكل ملحوظ.

في الختام، يمثل هذا التحول خطوة مهمة نحو تحسين تجربة الاستخدام عبر تقنية التعرف على الصوت، ويعزز أيضًا حدود دقة الأداء في مجالات متعددة. ما رأيكم في هذا الابتكار؟ شاركونا آراءكم في التعليقات!