يواجه تقدير النغمات المتعددة (Multi-pitch Estimation) في المجاميع الغنائية تحديات كبيرة، بسبب تداخل نطاقات النغمات التي يشغلها المغنون وغالباً ما يغنون عند ترددات أساسية متقاربة، مما يؤدي إلى تداخل التوافقيات في تمثيلات التردد الزمني. تعتمد النماذج الحالية على تمثيلات تعتمد على تحويل Q الثابت (HCQT) لتوفير دقة متجاوبة للتردد، ولكن ذلك يأتي مع تكلفة عالية لاستخراج الميزات، خصوصاً عند توليد المعزوفات بشكل آني.
في هذه الدراسة، نعيد النظر في هذا التصميم ونجري مقارنة بين HCQT وتحويل فورييه قصير الأمد الخطي (STFT)، حيث يتم تقديم صناديق الترددات كمدخلات مباشرة للنموذج. بالرغم من دقة التردد الثابتة وغياب شبكة مدخلات مرتبة حسب النغمات، فإن STFT الخطي يتفوق على HCQT، مما يقلل بشكل كبير من تكلفة استخراج الميزات.
تشير التحليلات الإضافية إلى أن استخدام نافذة تحليل أطول أو تغطية طيفية أوسع لا يوفر تحسيناً إضافياً، بينما يؤثر تقييد الإدخال إلى نطاق النغمات المتوقع على ميزة STFT الخطي. تدل هذه النتائج على أن الدقة للأخطاء المتعددة للأصوات الجماعية لا تعني بالضرورة تحسناً في الأداء، وأن النوافذ التحليلية الأقصر قد تكون أكثر فاعلية للنغمات الصوتية المتغيرة مع الزمن.
تحديات تقدير النغمات المتعددة: إعادة النظر في تمثيلات التردد الزمني للأصوات الجماعية
يتناول البحث تحديات تقدير النغمات في المجاميع الغنائية، حيث يغطي مغنون نطاقات نغمية متداخلة مما يجعله صعباً. ويقارن بين تمثيلات مختلفة لتحسين الدقة وكفاءة المكونات.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
