في عصر الذكاء الاصطناعي، تتطور الأساليب لتوليد الكلام والإيماءات بشكل متسارع، مما يفتح آفاقاً جديدة للتفاعل البشري الآلي. نقدم لكم في هذا المقال نظام DualTrack، الذي يهدف إلى تحسين التنسيق بين الكلام والإيماءات من خلال الجمع بين خبرات سابقة في إطار زمني مشترك يبلغ 12.5 هيرز.
تعتمد فكرة DualTrack على استخدام «محولات سببية» (Causal Adapters) التي تسمح بتبادل المعلومات بين حزم البيانات السابقة. كما يعمل النظام على دمج حالة البيانات الحالية، بحيث تتم معالجة كل من الكلام والإيماءات بكفاءة عالية، مع تحقيق تناسق في الأداء.
لقد تم اختبار DualTrack بأكثر من 43 تسجيلًا من «BEAT2» في أربع لغات مختلفة، حيث تم استبعاد المتحدثين من التدريب والتحقق. على المدخلات المشتركة بين الإنجليزية والإسبانية، حقق DualTrack معدل خطأ أقل في الكلمات، مع تقليل «مسافة إيماءة فريشيت» (Fréchet Gesture Distance)، مما يعني أداءً أكثر طبيعية وبساطة مقارنةً بأساليب تقليدية مثل «جليلينا» (GELINA).
هذا النظام يمثل خطوة كبيرة نحو تحقيق تفاعل أكثر إنسانية بين المستخدمين والروبوتات، ويعد بمستقبل واعد في عالم الذكاء الاصطناعي. إذًا، هل أنتم مستعدون لمشاهدة كيف ستتغير تجربة التفاعل الذكي مع هذه التطورات؟
DualTrack: ثورة في توليد الكلام والإيماءات بالتزامن!
يقدم البحث الجديد DualTrack نظام مبتكر لتوليد الكلام والإيماءات بالتزامن عبر دمج نماذج مسبقة التدريب. يظهر الأداء المتفوق للنظام مقارنةً بالأساليب التقليدية الأخرى في معالجة اللغات المتعددة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
