قفزت تقنيات توليد الصوت والفيديو من النص (Text-to-Audio-Video Generation) إلى آفاق جديدة في السنوات الأخيرة، لكن تقييم هذه الأنظمة ما زال يفتقر إلى الدقة عند التعامل مع جانب الصوت. مع وجود معايير تقييم الحالية التي إما تعالج الصوت كمكون إضافي في جودة الفيديو أو تقيّمه بشكل منفصل دون أخذ السياق السمعي البصري في الاعتبار، كان من الصعب تحديد نقاط الضعف والقوة في قدرة الأنظمة الحالية على توليد الصوت.
تقديمنا لـ PRISM-Bench يعد خطوة بارزة في هذا المجال، حيث يمثل أول معيار تشخيصي يركز على الصوت في عملية توليد الصوت والفيديو من النص. يعتمد PRISM-Bench على مجموعة بيانات تمت مراجعتها بدقة تضم 900 عينة تم التحقق منها من قبل البشر، وينقسم التقييم إلى محورين رئيسيين: نوع الصوت (كلام، موسيقى، وأصوات) ورؤية مصدر الصوت (مرئي على الشاشة وغير مرئي).
يقيم نقاء المحتوى المولد عبر أربعة أبعاد إدراكية (التناسق السمعي البصري، جودة الصوت، تعبيرية الصوت، والتوافق مع التعليمات) باستخدام 35 معيارًا دقيقًا. لضمان تقييم موثوق، قمنا بتبني بروتوكول MLLM-as-a-Judge المحسن، الذي يعتمد على مقارنات جانب إلى جانب مع مراجع حقيقية، مما يظهر توافقًا قويًا (أكثر من 70٪ متوسط توافق) مع مراجعي البشر.
التحليل الأخير لنماذج T2AV الحديثة أظهر وجود فجوة أداء كبيرة بين النماذج الرائدة والمصادر المفتوحة. علاوة على ذلك، أوضحنا أن الأنماط الحالية في التوليد تميل إلى الإفراط في الاعتماد على المصداقية الإدراكية، بينما تكافح مع مهام التحكم والتوجيه المعقدة، وخاصة في توليد الموسيقى وصوت الشاشة المتزامن.
PRISM-Bench: معيار تشخيصي مبتكر لتوليد الصوت والفيديو من النص!
PRISM-Bench يمثل الخطوة الأولى في تقييم فعّالية توليد الصوت والفيديو من النص بطريقة متقدمة. هذه الأداة الجديدة تعالج الثغرات في التقييم وتفتح آفاق جديدة لتقنيات الذكاء الاصطناعي في مجالات الوسائط المتعددة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
