في عالم تقنيات الذكاء الاصطناعي، تمثل أنظمة التعرف على الصوت (ASR) قفزة نوعية في كيفية تفاعلنا مع الأجهزة. وتُعد التقنية المعروفة باسم Whisper من أبرز تلك الأنظمة، حيث تعتمد على واجهة ترميز ثابتة تضم 1500 رمز. لكن، ماذا لو كان بإمكاننا جعل هذا النظام أكثر كفاءة؟
نقدم لكم تقنية جديدة تُعرف باسم Stride-k subsampling، وهي عملية فهرسة حتمية تحتفظ بكل "k" رمز بعد العملية الأولية للترميز. قد تمكنت هذه التقنية، كما تشير الدراسات، من تقليل عدد الرموز الصوتية بمعدل 75%، مما يسهم بشكل كبير في خفض طاقة الحسابات مما يصل إلى 58%. وهذا ليس كل شيء؛ فقد أثبتت التجارب أن تطبيق هذه التقنية يحافظ على دقة أدنى معدل أخطاء الكلمات (WER) ومواءمة فعالة بين الأداء واستهلاك الموارد.
عبر خمسة مقاييس مختلفة لنظام Whisper، أظهرنا أن استخدام k=2 لم يؤثر بصورة ملحوظة على دقة النموذج، حيث انخفضت التكلفة من حيث الموارد المستخدمة مقارنةً بالنهج التقليدي. كما لوحظ انخفاض في فترة الاستجابة النهائية بنسبة تتراوح ما بين 19.6% إلى 27.4%.
يمكن تطبيق نفس الإعداد على ثلاث نماذج أخرى قائمة على Whisper، مما يوفر أداءً مرضيًا مع أقل تغييرات ملحوظة في الدقة على الأنماط الأقوى.
إن تقنية Stride-k subsampling ليست فقط ابتكارًا في عالم الذكاء الاصطناعي، بل تمثل خطوة كبيرة نحو تقليل الحاجة للتدريب الإضافي أو الحسابات المرتبطة، مُستغلة ذلك الاعتماد على الازدواجية في معالجة البيانات الصوتية. هل أنتم مستعدون لاستكشاف المزيد من هذه التقنيات الرائدة؟
ثورة تقنيات الصوت: كيفية تقليص عدد الرموز الصوتية بدون تدريب باستخدام Stride-k
تقدم تقنية Stride-k subsampling طريقة جديدة لتقليل الرموز الصوتية في نظام Whisper بشكل فعال، مما يحسن الأداء مع تقليل التعقيد. هذه التقنية تفتح آفاقًا جديدة للكفاءة في التعامل مع البيانات الصوتية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
