في عالم الذكاء الاصطناعي وتكنولوجيا الصوت، يُعد تقييم تركيب الصوت (prosody) أحد التحديات الأساسية، خصوصاً في سياقات مثل البث المباشر وتحويل النص إلى كلام (Text-to-Speech). وقد أثبتت الأساليب التقليدية، مثل مؤشرات نوعية خدمة العملاء (MOS)، عدم قدرتها على التقاط عناصر التعبير الدقيقة مثل العواطف والنبرة والطاقة.

للتغلب على هذه التحديات، قدم فريق البحث الأداة الجديدة Live-ProsodyJudge (LPJ)، وهي مقياس فعّال ذو تكلفة منخفضة تم استخلاصه من النموذج التجاري الشهير Gemini باستخدام نموذج Qwen3-Omni. لكن الباحثين اكتشفوا أن هناك عيبًا كبيرًا في منهجية تقييم الأبعاد المتعددة التقليدية، وهو "الزواج الحتمي للحكم"، حيث تميل النتائج إلى التوافق مع تفضيلات شاملة، مما يؤدي إلى تقليص معايير التقييم المتنوعة إلى تقييم واحد فقط.

لذا، تم تطوير نسخة محسنة تُدعى Decoupled-Live-ProsodyJudge (D-LPJ)، التي تهدف إلى فصل الأحكام بحيث تتمكن من تقديم تقييمات مستقلة ودقيقة لأبعاد الصوت المختلفة. تشير النتائج إلى أن LPJ، من خلال اختبارات دقيقة شهدت تصنيفًا عالياً من قبل متحدثين بشر، حقق دقة أكثر في التقييم مقارنة بعملية واحدة من Gemini، بينما نجح D-LPJ في إنتاج أحكام مستقلة لكل بعد من أبعاد الصوت.

علاوة على ذلك، في تجربة اختيار المرشحين، أظهرت الأداة قدرة LPJ على الاقتراب من اختيارات البشر، حيث كان الاختيار الذي تم بواسطة LPJ ضمن أفضل 3 حالات في 85.29% من الحالات عالية الثقة. تُثبت هذه النتائج قدرة تقنيات الذكاء الاصطناعي في تحسين تفضيلات تحويل النص إلى كلام، مما يمنح المستخدمين تجربة استماع أكثر إنسانية وواقعية.

إن هذه التطورات تمثل حقبة جديدة في تطوير تكنولوجيا الصوت، والتي ستحدث تأثيراً كبيراً على كيفية تفاعلنا مع الآلات ووسائل التواصل في المستقبل. ما رأيكم في هذا التطور؟ شاركونا في التعليقات.