في عالم الذكاء الاصطناعي سريع التطور، تعتبر تقنيات تحويل النصوص إلى كلام (Text-to-Speech) واحدة من المشاريع الأكثر تأثيراً. ومع أن النماذج الحديثة حققت تقدماً ملحوظاً من حيث الطبيعية، يبقى التحكم في التعبير الدقيق من خلال التعليمات اللغوية الطبيعية تحدياً صعباً. ولكن الآن، قدم فريق من الباحثين تقنية Poly-InstructTTS، التي تُحدث تحولاً جذرياً في طريقة كيفية تعلم الكلام المعبر.

تستند Poly-InstructTTS إلى فكرة التعليم من خلال بيانات سمعية بصرية متاحة للعامة، حيث تم إنشاء مجموعة بيانات تضم 1,000 ساعة من التعليمات المعلّمة، مما يُغطي أكثر من 1,000 عاطفة و نمط تعبيري دقيق. هذه التقنية تدعم تحسين الأداء بفعالية من خلال استخدام نموذج GPT بدون موجهات، جنباً إلى جنب مع مجموعة من الوحدات المنهجية التي تساعد في تضمين طابع الصوت من تسجيلات مرجعية.

بالإضافة إلى ذلك، تم تحسين الإعداد لاستهداف المتحدثين بدقة أثناء الاحتفاظ بالشخصية المميزة لكل منهم. وقد أظهرت التجارب أن Poly-InstructTTS تتمتع بقدرة استثنائية على الالتزام بالتعليمات والتعبير العاطفي. يمكن للاطلاع على أمثلة صوتية ومجموعة الاختبارات الموسعة من خلال صفحة المشروع الخاصة بهم.

مع هذه الابتكارات، نحن نقترب أكثر من تحقيق تواصل بنفس مستوى الإنسان. كيف تبدو هذه التطورات من وجهة نظرك؟ هل تعتقد أنها ستغير طريقة تفاعل الناس مع التكنولوجيا؟ شاركونا آراءكم في التعليقات!