في تطور مثير في عالم الذكاء الاصطناعي والموسيقى، تم تقديم إطار عمل موحد قادر على إنتاج موسيقى كاملة بجودة عالية من خلال الاستناد إلى النصوص، والأوصاف، والخصائص الصوتية. يهدف هذا النظام المبتكر إلى إثبات قوته من خلال ثلاثة مهام رئيسية:
1. **توليد الأغاني من الكلمات (Lyrics-to-Song Generation)**: حيث يُنتَج أغاني كاملة بناءً على وصف نصي أو كلمات محددة.
2. **توليد الموسيقى الآلية (Instrumental Music Generation)**: التركيز على إنشاء ألحان موسيقية دون أصوات غنائية.
3. **توليد أغاني تغطية (Cover Song Generation)**: إعادة تفسير الأغاني الموجودة بأساليب مختلفة، مع الحفاظ على المحتوى اللحن الأصلي.
يتألف هذا النظام من أربعة مكونات رئيسية:
- **مُحَوِّل حساس للمعاني (semantic-aware tokenizer)**: يشفّر الصوت إلى رموز RVQ ذات 8 رموز لتوفير تمثيل موسيقي فعال.
- **نموذج لغوي هجين (hybird-LM)**: يقوم بنمذجة رموز الصوت بتقنية الاستجابة الذاتية الهرمية لتوليد الأغاني بالكامل.
- **FullDiT**: يُحسّن من جودة الصوت من خلال مطابقة تدفق الأغاني في مساحة VAEs مستمرة بناءً على الرموز والكلمات.
- **وحدة اللحن الثنائية المستوى**: تستخرج الإشارات اللحنية من الصوت المرجعي لتوجيه عملية التوليد مع الحفاظ على محتوى اللحن الأصلي.
علاوة على ذلك، تم التحقيق في استراتيجيات تحسين مثل DPO وGRPO وOPD، لرفع مستوى الجودة الموسيقية والتصوير.
أظهرت التجارب التي أُجريت على مجموعة بيانات متعددة اللغات أن هذا الإطار الجديد يُحقق أداءً تنافسياً كبيراً، مما قد يجعل منه إنجازاً رائداً في عالم الموسيقى الذكية!
خطوة ثورية في توليد الموسيقى: إطار عمل موحد لإنتاج الأغاني بالكامل!
تم تطوير إطار عمل موحد قادر على إنتاج موسيقى كاملة بجودة عالية من النصوص والأوصاف الموسيقية. يشمل النظام ثلاث مهام رئيسية، مما يعد بفتح آفاق جديدة في عالم إنتاج الموسيقى.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
