في عصر الذكاء الاصطناعي المتزايد، تظهر تقنيات جديدة تغير قواعد اللعبة في مجال التعرف على الصوت. أطلقت مجموعة من الباحثين فكرة مبتكرة تُسمى DuplexJev، والتي تسمح للوكلاء الصوتيين باتخاذ قرارات سريعة وفعالة دون الحاجة إلى عملية فك التشفير المعقدة.

تعتمد تقنية DuplexJev على استخدام حالات خفية من مُشفّر التعرف على الصوت (ASR) عبر وصلة صغيرة إلى نموذج لغوي ضخم (LLM) مجمد. وبدلاً من الاعتماد على عمليات فك التشفير البطيئة، تتم قراءة كل سؤال كنشرة توزّع على خيارات عدة، مما يُتيح للوكلاء الصوتيين الإجابة عن 80 قرارًا يتعلق بثمانية نطق في حوالي 0.1 ثانية فقط.

وبفضل تحسينات إضافية، تمكنت DuplexJev من تحقيق دقة عالية تصل إلى 90% في التعرف على نوع المتحدث والعواطف، بعد أن كانت تصل في السابق إلى 55% و28% على التوالي. كما أن استخدام وصلة انتباه متقاطعة يحافظ على دقة السؤال والجواب المنطوق بنسبة 82%.

بجانب ذلك، تم تدريب تقنية DuplexJev باستخدام خوارزمية الانتروبيا المتقاطعة على إجابات النشر بدلاً من تقطير النص التقليدي، مما يُعطي النتائج الصوتية مزيدًا من الدقة.

هذا الابتكار يعد إنجازًا غير مسبوق في عالم الوكلاء الصوتيين، حيث يتمكن الباحثون من إطلاق الأوزان، ووصفة التدريب، وخط أنابيب الاستدلال المدور بالكامل مع مجموعة شاملة من الأسئلة والأجوبة الصوتية الثنائية اللغة، مما يفترض وجود انطلاقة جديدة في عالم الذكاء الاصطناعي.