في عالم الذكاء الاصطناعي، تصبح نماذج تحويل النص إلى صوت وصورة (T2AV) أداة ثورية، تتمكن من توليد فيديو، خطاب، مؤثرات صوتية، وأجواء من نص مكتوب واحد فقط. لكن مع هذه التقنية الحديثة، تنشأ تحديات جديدة تتطلب تقييم الأمان بشكل دقيق، حيث يمكن أن تحمل المسارات الصوتية مخاطر غير مرئية عند تحليل المخرجات بصرياً وصوتياً.

لملء الفجوة الحالية في معايير الأمان، تم تقديم AV-SafetyBench، وهو المعيار الأول المصمم خصيصاً لتوليد T2AV. يتكون هذا المعيار من تصنيف يتضمن أربعة محاور و13 فئة، بالإضافة إلى 5,200 مدخل تمت مراجعتها يدوياً، تحدد المشاهد المرئية، الخطابات، والأصوات غير الخطابية.

تعتمد آلية التقييم على ثلاثة أبعاد: كامل T2AV، الفيديو فقط، والصوت فقط. ومن ثم يتم استخدام الأحكام الخاصة بالفيديو والصوت لتحديد مصدر المخاطر بالنسبة للمخرجات الكاملة، وقد تم تقييم خمسة نماذج T2AV مفتوحة المصدر، وتمت مقارنة الأحكام الآلية ضد التعليقات البشرية.

وجدت الدراسة أن معدلات الأمان للمخرجات الكاملة تتراوح بين 25.1% و49.4%، مما يشير إلى احتياج ملح لتطوير أدوات أكثر دقة في الاختبارات. كما وجدت التحليلات أن 41.6% إلى 48.3% من المخرجات غير الآمنة لم تستطع عملية التقييم بالفيديو فقط تحديدها. ووضعت النتائج AV-SafetyBench كمفتاح رئيسي لتقييم أمان T2AV بشكل شامل يعكس التداخل بين المقاييس الصوتية والمرئية.