في خطوة جريئة نحو المستقبل، تم تقديم إطار عمل جديد يُدعى Composer–Performer–Refiner (CPR) يهدف إلى تعزيز أداء البيانو في توليد الموسيقى من نماذج MIDI. يعتمد هذا الإطار المبتكر على دمج مزايا النماذج التلقائية (Autoregressive Models) ونماذج التدفق (Flow Matching) لتحسين دقة الصوت وجودة الموسيقى.

حيث توفر نماذج AR القدرة على التنبؤ بالتسلسل الزمني للأصوات بدقة، لكنها قد تخسر بعض التفاصيل الصوتية بسبب التكميم. بينما يحتفظ التدفق بالهيكل الصوتي بشكل أفضل، فإنه يأتي بتكاليف مرتفعة في معالجة التسلسلات الكاملة.

يستفيد نموذج CPR الجديد من النمذجة المستمرة التي تعمل مباشرة على التمثيلات المستمرة، مما يقلل من تكاليف المعالجة ويعزز جودة الصوت. تتضمن مراحل العمل: يتنبأ Composer بالحالات الخفية بشكل تلقائي، بينما ينتج Performer الصوتيات بتردد 24 كيلو هرتز من خلال عمليات التدفق المحلية. وفي النهاية، يقوم Refiner بزيادة تردد الإشارات إلى 48 كيلو هرتز.

كما تم تقديم تقنيات جديدة مثل محاذاة التمثيلات الضيقة (Bottlenecked Representation Alignment - BREPA) وموضع صوت-وقت (Modality–Time RoPE - MT-RoPE)، لتعزيز البنية الدلالية الموسيقية.

هذه الإبداعات تفتح أبواباً جديدة أمام الموسيقيين والمطورين على حد سواء لتجربة أشكال جديدة من التعبير الفني، مما يجعلها لحظة محورية في مجال الذكاء الاصطناعي والموسيقى. هل أنت مستعد لاستكشاف هذا العالم الجديد من المؤلفات الموسيقية التي يدعمها الذكاء الاصطناعي؟ شاركونا آرائكم في التعليقات.