في خطوة تاريخية نحو تعزيز قدرة الذكاء الاصطناعي على فهم وتجسيد تفاعلات الجدل، تم الإعلان عن مجموعة بيانات جديدة تتعلق بالمناقشات التنافسية باللغة الصينية. هذه المجموعة تم تطويرها لتكون بمثابة مرجع لتقييم نماذج اللغة الضخمة (Large Language Models) من حيث قدرتها على تحليل وإدراك المجادلات.

تتكون مجموعة البيانات الجديدة من 182 مباراة، تم تنظيمها بمشاركة 120 قاضيًا محترفًا، حيث تم تقييم كل مباراة بواسطة ثلاثة قضاة مختلفين وفقًا لمعايير محددة مسبقًا. بعد استبعاد المباريات ذات السجلات الغير مكتملة، تحتوي مجموعة البيانات على 148 مباراة، و2,698 مرحلة، و20,542 وحدة تبادل، مع نصوص تم التحقق منها يدويًا وتجزئة دقيقة.

تساهم هذه المجموعة في الحفاظ على الدرجات الأصلية للمرحلة، وأصوات المباريات، وأفضل الممثلين، بالإضافة إلى مرتكزات تقييمية للقضاة. كما تم تعريف ثلاثة مهام رئيسية للتفاعل، وهي: توقع الفائز، وتوقع درجات المرحلة، وتوقع أفضل متحدث.

أظهرت التقييمات الخالية من التعلم (Zero-shot evaluation) لعدة نماذج لغوية ضخمة دقة في توقع الفائز تصل إلى 66.2%، كما حققت أعلى ارتباط بيرسون (Pearson correlation) قدره 0.250 بين درجات المرحلة للنموذج وتقييمات البشر المتوسطة، ودقة في توقع أفضل المتحدث تصل إلى 56.8%.

تعد هذه المجموعة من البيانات والأدوات الجديدة اختباراً مهماً لدراسة فهم نماذج اللغة الضخمة للجدل التفاعلي ومدى توافقها مع القضاة المحترفين، مما يفتح آفاقاً واسعة للاستخدام المستقبلي في تقنيات الذكاء الاصطناعي.