في عصر تتزايد فيه الموسيقى المُنتجة آلياً، تظهر تساؤلات هامة حول الشفافية وتعويض الفنانين. ومع تزايد الاعتماد على هذه الموسيقى داخل وسائل الإعلام، يبقى السؤال حول فعالية تقنيات كشف تلك الأعمال بشكل موثوق تحت ظروف البث المباشر دون إجابة واضحة.

تتحدث دراسة جديدة تُنشر في arXiv عن العمل نحو سد هذه الثغرة. حيث تقدم مجموعة بيانات جمعُت تحت اسم BAMM (Broadcast AI-Music Monitoring) تتضمن تسجيلات واقعية من التلفزيون، تشمل 40 ساعة من الموسيقى المُنتجة آلياً وأخرى بشرية. تعتبر هذه المجموعة أول محاولة لتقييم تقنيات كشف موسيقى الذكاء الاصطناعي في بيئات حقيقية، بدلاً من الاعتماد على بيانات صناعية.

تتناول الدراسة مقارنةً بين نماذج الشبكات العصبية التلافيفية (CNN) المدربة على data النظيفة وغيرها المدربة على بيانات البث، عبر ثلاثة سيناريوهات متفاوتة الصعوبة: موسيقى أمامية نظيفة (Clean Foreground Music - CFM)، بث تلفزيوني صناعي (Synthetic TV Broadcast - STB)، وبث تلفزيوني حقيقي (Real TV Broadcast - RTB).

أظهرت النتائج أن كلا النموذجين يحقق أداءً مثاليًا تقريبًا على سيناريو CFM، لكنها تتدهور بشكل كبير عند التطبيق على بيانات البث الصناعي. كما اتضح أن التدريب الموجه للبث يعزز مقاومة النموذج، إلا أن الأداء لا يزال محدودًا. وعند اختبار RTB باستخدام مجموعة بيانات BAMM، تدهور الأداء أكثر مع وجود تداخل كبير بين الدرجات الخاصة بالموسيقى المُنتجة آلياً وتلك البشرية.

تسلط هذه النتائج الضوء على فجوة حرجة في الأداء الحالي، مما يدل على أن الأساليب التدريبية المستخدمة في الكشف عن الموسيقى المُنتجة آليًا لا تزال غير كافية لتحقيق موثوقية في رصد الموسيقى خلال عمليات البث المباشر.