في عالم الذكاء الاصطناعي، يعد نموذج Whisper من أبرز النماذج المستخدمة في التعرف التلقائي على الصوت (ASR). ورغم شعبيته، إلا أن نموذج Whisper يواجه تحديات في إنتاج نصوص هلاوسية عند التعامل مع مدخلات تحتوي على القليل من الكلام أو لا تحتوي عليه. ولكن، ماذا لو قلنا لك إنه تم اكتشاف طريقة ثورية لتحسين ذلك؟

يقدم الباحثون نهجًا مبتكرًا يعتمد على تقنية السماح باستخدام التصحيح التحليلي (hallucination space projection) في مرحلة الاستدلال، مما يقلل بشكل ملحوظ من إنتاج النصوص الهلاوسية بدون الحاجة إلى إعادة تدريب النموذج.

كيف يعمل هذا؟ يتم تقدير مجال فرعي مرتبط بالهلاوس من بيانات المعايرة غير الكلامية، ومن ثم تُسقط حالات التشفير المخفية (hidden states) بعيداً عن هذا المجال أثناء فترة الاستدلال. وقد تم تقييم طريقتين: الأولى تطبق التقدير على جميع المدخلات بشكل دائم، والثانية تُطبق فقط عندما يتوقع Whisper أن المدخل المحتمل غير منطوق.

نتائج هذه الدراسة مثيرة للإعجاب؛ حيث خفضت الطريقة الأولى (دائمة التشغيل) معدل الهلاوس من 31.31% إلى 2.44%، مما يمثل انخفاضًا نسبيًا بنسبة 92.21%. بينما في الطريقة الثانية (المستندة إلى التوقع) انخفض المعدل إلى 3.74%، مع تقليل معدل الرفض الخطأ للكلام الحقيقي.

وتشير النتائج إلى أن تقنية الإسقاط منخفض الرتبة (low-rank activation projection) يمكن أن تقطع شوطًا طويلًا في تقليل الهلاوس في مدل Whisper دون الحاجة لإعادة تدريبه، مما يتيح تحقيق توازن بين تحسين أداء التعرف على الكلام وتخفيض الهلاوس.

في ضوء هذه النتائج المثيرة، كيف ترى أثر هذه التقنية على تحسين أنظمة التعرف على الصوت؟ شاركونا آرائكم في التعليقات!