في عصر الذكاء الاصطناعي، يتزايد دور الترميزات الصوتية المتقدمة في نمذجة لغة الكلام، حيث تلعب codecs الصوتية العصبية (Neural audio codecs) دوراً مهماً. ولكن، يؤدي ارتفاع معدلات الإطارات إلى إطالة التسلسلات، مما يزيد من التكاليف الحاسوبية بشكل كبير. لمواجهة هذا التحدي، تعتمد codecs الصوتية ذات معدلات الإطارات الديناميكية (Dynamic frame rate codecs) على تقنيات الضغط لتقليل المعدل الفعال للإطارات من خلال دمج عدة إطارات معاً.
تحديداً، تقنيات الضغط التقليدية غالباً ما تقتصر على codecs ذات كتاب شفرة واحد (Single-codebook codecs) أو تستخدم خطوة ضغط واحدة قبل التكميم متعدد الطبقات. هذه الاستراتيجيات تُجبر جميع طبقات الكود على مشاركة نفس حدود التقسيم، رغم أن التمثيلات المتبقية في الطبقات المختلفة تُظهر معدلات تغير متباينة بمرور الوقت.
هنا يأتي دور LACE (Layer-Adaptive Codec Encoding) كحل مبتكر، حيث تقدم codec بمعدل إطارات ديناميكي يسمح بتطبيق خطوة ضغط مستقلة في كل طبقة تكميم، مما يمكّن من حدود تقسيم خاصة بكل طبقة. مما يجعل استخدام رموز LACE في تحويل النص إلى كلام (TTS) أكثر كفاءة، فقد قمنا أيضاً بتقديم آليات توافقية (union alignment) وآليات مرساة للحدود (boundary anchor) لضمان تزامن الأوقات عبر الطبقات مع الحفاظ على فوائد الضغط.
تظهر التجارب على LibriTTS أن LACE تتفوق على الطرق السابقة في تحقيق توازن أفضل بين المعدل والجودة في مهمة إعادة الإعمار، كما تحسن كفاءة استدلال TTS مع الحفاظ على جودة توليد تنافسية. يمكن للجميع الوصول إلى الرمز البرمجي الذي أطلق كجزء من وصفة codec ESPnet3.
ما رأيكم في هذه التقنية المبتكرة؟ شاركونا أفكاركم وتجاربكم في التعليقات!
LACE: ثورة في ضغط الترميز الصوتي الديناميكي وتحسين الكفاءة!
تقدم LACE تقنية مبتكرة لضغط الترميز الصوتي الديناميكي، مما يساهم في تحسين كفاءة النموذج وتخفيض التكاليف الحسابية. بالاعتماد على تقنيات جديدة، يحقق LACE نتائجً أفضل في معالجة الصوت وتحويل النص إلى كلام.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
