في عالم الذكاء الاصطناعي، يتزايد استخدام نماذج الحوار الصوتي التي تدعم التحكم في الشخصيات، لكن حتى الآن ظلت المعايير المتاحة تركز بشكل كبير على الأدوار القصيرة والشخصيات النمطية. ومن هنا، يبرز دور Break كمبادرة جديدة كليًا تهدف إلى قياس مدى قوة نماذج الحوار في سياقات متعددة الأدوار وعبر حوارات طويلة.
يحتوي معيار RoleBreak على 310 دورًا قائمًا على الشخصيات وأدوار موجهة للمستخدم، تتضمن 6,688 جولة حوار تم التحقق منها بواسطة البشر، و11,743 معيار تقييم دقيق. من بين هذه الجولات، تحمل 1,856 جولة أهدافاً للتعبير العاطفي، مما يتيح قياس التعبير الصوتي. صُممت السيناريوهات بعناية لتقييم استمرارية الأدوار، وجودة التفاعل، والسلامة، والانفعالات على المدى الطويل.
لقد تم تقييم تسع تكوينات مختلفة تشمل تقنيات التعرف على الصوت (ASR) ونماذج اللغة الكبيرة (LLM) ونماذج تحويل النص إلى صوت (TTS). تشير النتائج إلى أربع أنماط رئيسية: 1) الأنظمة الحالية أقوى بشكل ملحوظ في الالتزام بالأدوار الدلالية مقارنة بالتعبير الصوتي. 2) الاستمرارية الدلالية تبقى هشة على المدى الطويل: حتى أقوى الأنظمة تواجه أولى إخفاقاتها في الالتزام بالشخصية والسلامة بعد 10.4 و11.6 جولة على التوالي. 3) توسيع نموذج اللغة الكبيرة يحسن من الاستمرارية الدلالية ولكنه لا يعزز التعبير الصوتي بشكل كبير. 4) تأثير صوت المستخدم يعزز من سلوك لعب الأدوار حتى عند تثبيت المحتوى اللغوي. تكشف هذه النتائج عن الفجوات المستمرة في كفاءة الأداء في الأنظمة الصوتية الخاصة بلعب الأدوار.
دورBreak: معيار جديد لقياس قوة الأداء في حوارات الأدوار الطويلة!
تقدم RoleBreak، معياراً جديداً لقياس كفاءة نماذج الحوارات الصوتية في أداء الأدوار على المدى الطويل. يتضمن المعيار مجموعة ضخمة من الحوارات والأدوار المتنوعة، مما يعكس إمكانيات التفاعل البشري المعقد.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
