تقييم تقنيات تحويل النص إلى كلام (TTS) يعد من المواضيع المتطورة في مجال الذكاء الاصطناعي، حيث يُتوقع من طرق تقييم المواقف الذاتية مثل متنبئات درجات الرأي المتوسطة (Mean Opinion Score - MOS) وحكام نماذج اللغات كبيرة الحجم الصوتية (Audio Large Language Models - Audio-LLM) أن تعكس إدراك البشر بدقة. ومع ذلك، فإن مدى قدرتها على التقاط الأبعاد المميزة للكلام كما يدركها المستمعون لا يزال غير واضح.

في دراسة جديدة، قام الباحثون بتفكيك مفهوم "الطبيعية" (Naturalness) ليصبح نظاماً توضيحياً مدعوماً باللغويات يمتد على عشرة أبعاد إدراكية مميزة. استخدمت هذه الأبعاد لإنشاء أول معيار تقييم على مستوى الأبعاد لتقنيات تحويل النص إلى كلام، حيث تم استخدام 860 عبارة تم تقييمها من قبل مختصين لغويين.

أظهرت نتائج قياس أربعة متنبئات من نوع MOS وأربعة حكام من نوع Audio-LLM أن متنبئات MOS ترتبط بجودة الإشارة الصوتية، بينما أظهرت نماذج Audio-LLM اكتشافات انتقائية تعتمد على المحفزات، مما لا يعمم عبر جميع الأبعاد. كما أن أي من الفئتين لم يستطع التقاط كافة الأخطاء الهيكلية اللغوية بشكل موثوق.

لضمان تقديم نتائج أكثر استهدافاً وقابلية للتفسير، أطلق الباحثون مجموعة البيانات ونظام التقييم العام للجمهور. هل أنتم مستعدون لاستكشاف عالم تقييم تحويل النص إلى كلام بعمق أكبر؟