في عالم سريع التغير من تقنيات الذكاء الاصطناعي، تكشف تقنية جديدة تدعى Salt++ عن إمكانيات هائلة في توليد المحتوى المتعدد الوسائط، والذي يدمج بين الصوت والفيديو بشكل متزامن. تقوم هذه التقنية، التي تعتمد على نموذج تدريبي ثنائي المرحلة، بمعالجة التحديات التي تواجه معظم أساليب التدريب التقليدية.

أحد أبرز هذه التحديات هو أسلوب التوجيه التعليمّي (Teacher Forcing)، والذي يعمد إلى مزج تاريخ نظيف مع أهداف ذات ضجّة، حيث يوجّه أساسًا التمثيلات السياقية التنبؤية من خلال توقع السرعة. ومع ذلك، فإن استخدام نماذج التقييم ذو الاتجاهين في عملية تقليم التوزيع الاحتمالي (Causal Distribution Matching Distillation) غالباً ما يؤدي إلى عدم تطابق بين سياقات التوليد والتقييم.

لكن Salt++ تمتلك الحل؛ فهي تستخدم تقنية Flow الذاتي السباقة (Causal Self-Flow) التي تستفيد من عدم التوازن في المعلومات السياقية عن طريق تغيير التاريخ مع الحفاظ على الهدف الضاج؛ وهذا يتيح للطالب أن ينسق تمثيلاته الوسيطة مع تلك الخاصة بالمعلم.

من خلال تطبيق مُوجه مُعتمَد، تستطيع Salt++ تحقيق تحسينات ملحوظة في جودة الحركة والصورة، حيث تسجل تحسنًا بنحو 57% و45% على التوالي، مقارنةً بأسلوب OmniForcing. يتمركز الابتكار في قدرة Salt++ على التكيف مع تواريخ مولدة دون الحاجة إلى التبديل بين الأهداف أو المتطلبات الخاصة بالتسلسل المتسق.

بفضل تقنيتها المتطورة وأدائها الواضح، تؤكد Salt++ على أنها ليست مجرد تطور طفقي في مجال الذكاء الاصطناعي بل إنجازًا بارزًا يعد بفوائد مذهلة في المستقبل.