في عالم الذكاء الاصطناعي، صار تقييم أداء نماذج المحادثة (Chatbot Models) أمراً بالغ الأهمية. لذا، قدم الباحثون نظاماً جديداً يدعى TRACE Bench، وهو إطار عمل مدفوع بالمهام لتقييم الأدوار التفاعلية. لا يكتفي هذا النظام بإعطاء درجة واحدة، بل يكشف أيضًا عن متطلبات الأدوار التي تم اختبارها، ما تم الإخفاق فيه، والأدلة الحوارية التي تدعم هذه الأحكام.

TRACE Bench يعتمد على تحليل كل ملف تعريف لدور معين سابقاً ووضع قائمة متطلبات ثابتة. ثم يتفاعل وكيل المستخدم (User Agent) بشكل طبيعي مع النموذج المستهدف أثناء تحديث حالة القائمة الخاصة بتلك المتطلبات بشكل خاص استنادًا إلى ردود النموذج. وهذه الطريقة تعيد توصيل تقييم الأداء بالعناصر المحددة في القائمة والدور بدلاً من الاعتماد على انطباع عام غامض.

لزيادة موثوقية التقييم، تم تدقيق نصوص المحادثات المجانية التي تم إصدارها من MiniMax Role-play Benchmark، حيث تغطي فقط 73.74% من النقاط الرئيسية في ملف تعريف الدور. بينما يصل TRACE Bench إلى 99.91% من التغطية في عدد أقل من التفاعلات.

تشير التجارب التي تم إجراؤها إلى أن النظام يمتاز بالاستقرار في الترتيب تحت تكرار التجارب واستبدال وكلاء المستخدم. ومن ثم، يقدم TRACE Bench تقييمات شاملة للترتيب العام، بالإضافة إلى تحليلات قدرات العناصر وقوائم التحقق.

بالإضافة إلى ذلك، يدعم الإطار تطوير معايير التقييم في حلقات مغلقة لضمان إمكانية التحقق المستمرة وموثوقية الكشف عن أنماط الفشل الملاحظة. إن TRACE Bench يمثل خطوة جديدة نحو تحسين دقة تقييم أداء نماذج الذكاء الاصطناعي ويعزز من الفهم العميق لتفاعلاتها، مما يمهد الطريق لمستقبل واعد في عالم الذكاء الاصطناعي.