في مجال الذكاء الاصطناعي، تتزايد أهمية تحسين التفاعل الصوتي بين الأنظمة المختلفة. أحد التطورات المثيرة في هذا السياق هو "DuplexSpeechBench-IFEval" (DSB-IFEval)، الذي تم تصميمه خصيصًا لتقييم التفاعل الصوتي الفوري في الوكلاء الصوتيين مزدوجي التعامل.

تتطلب هذه الوكلاء القدرة على إدارة المحادثة بشكل فعال، مما يتضمن اتخاذ قرارات حول متى يجب عليهم الاستماع، كيفية التعامل مع الحديث المتداخل، وإدارة أدوارهم الصوتية المختلفة. ولكن المشكلة تكمن في أن الكثير من المعايير الحالية تعتمد على تعليمات صريحة، في حين أن الأنظمة المستخدمة في الواقع غالبًا ما تعتمد على أدوار أو شخصيات يجب استنتاج سلوك المحادثة المناسب منها.

يتضمن "DSB-IFEval" 1,038 حالة اختبار تغطي ثمانية أدوار مساعدة متنوعة، ويقيم خمسة بروتوكولات شرطية مختلفة لتتبع التعليمات:
1. السلوك الافتراضي
2. تعليمات سلوكية واضحة
3. سلوك يستدل من الشخصية
4. مزيج بين الشخصية والتعليمات
5. الصراع في التعليمات

من خلال قياس إدارة اللحظة في المحادثة باستخدام "Instruction Adherence Score" (IAS)، و"Persona Adherence Score" (PAS) الذي يحكمه نموذج لغوي كبير (Large Language Model). أظهرت النتائج وجود تفاوتات تعتمد على هندسة الأنظمة. على سبيل المثال، الأنظمة مزدوجة القناة مثل F-Actor وPersonaPlex كانت أكثر حساسية لما إذا كان سلوك المحادثة تم الإشارة إليه بشكل صريح أو استنتاجه من الشخصية، مما أدى إلى انخفاض الطاعة بنسبة 9.7% و4.5% على التوالي.

بينما أظهرت الأنظمة مثل GPT-Realtime، MiniCPM-o، وFun-Audio-Chat التزامًا قويًا بالمحتوى المتسق مع الشخصية، لكن سلوكها في إدارة اللحظة لم يتكيف بشكل ملائم مع التعليمات الصريحة أو تلك التي تعتمد فقط على الشخصية. وتشير النتائج إلى أن أنظمة الذكاء الاصطناعي لا تزال تواجه تحديات في فهم السلوكيات الضمنية، وتنفيذها في اللحظات المناسبة، وتجاوز التعليمات المتعارضة.

في الختام، يُظهر "DuplexSpeechBench-IFEval" كيف يمكن أن يكون تقييم التفاعل الصوتي أداة قوية لتحسين أداء الوكلاء الصوتيين وتحليل تحدياتهم. هل تجد هذا التطور مثيرًا؟ شاركنا برأيك في التعليقات!