في عالم الذكاء الاصطناعي، تعد تقنيات تحويل النص إلى كلام (TTS) من أبرز الابتكارات التي ساهمت في تحسين تجربة المستخدم. لكن مع تزايد الاستخدام، يبرز التحدي في كيفية إدارة تكاليف التشغيل على منصات الخوادم الخالية.

أظهرت دراسة حديثة أنه مع اعتماد منصات تخدم بتكلفة تعتمد على وقت استخدام وحدة المعالجة المركزية (CPU) وذاكرة العبور، فإن الحالة الساكنة تؤدي إلى تكاليف مباشرة. من خلال تحسين طريقة خدمة النص إلى صوت باستخدام تقنيات ذكية، يمكن تقليل هذه التكاليف بشكل كبير.

تقدم هذه التقنية الجديدة نظاماً يُعرف بتقنية التحكم في التكلفة، والذي يعمل على معالجة كفاءة استخدام CPU والثانية للذاكرة بدلاً من التركيز فقط على سرعة الإنتاجية أو الاستجابة الزمنية. وهذا يعني أنه يمكن تحقيق نتائج ملحوظة مع استهلاك أقل.

تمكن النظام الجديد العامل مع نموذج Kokoro-82M من تحقيق 2.71 ثانية صوت لكل ثانية CPU، مقارنة بـ 0.89 ثانية عند استخدام النماذج التقليدية، مما يُظهر فعالية التحسينات المدخلة. كما أن تكلفة الساعة الصوتية انخفضت من 0.0631 دولار إلى 0.0153 دولار، أي بانخفاض يصل إلى 4.1 مرة.

يساهم هذا التطور في توفير ذاكرة مفوترة، حيث انخفضت من 8.7 جيجابايت إلى 1.33 جيجابايت، بينما تم تسريع استعادة أول مقطع صوتي من 7.7 ثانية إلى 2.2 ثانية. ومن المهم أن هذا النوع من التحسينات يصبح ضرورياً مع حركة المرور المتقطعة لضمان تقليل التكاليف.

تشكل هذه الإنجازات نقطة تحول في كيفية تعاملنا مع تكاليف الذكاء الاصطناعي، مما يفتح الباب أمام المزيد من الابتكارات المستقبلية في هذا المجال.