في عالم الذكاء الاصطناعي، يعد تقييم الوكلاء الحواريين (Dialogue Agents) خطوة أساسية لضمان فعالية هذه الأنظمة في تلبية احتياجات المستخدم. لكن كيف نضمن أن كل ردّ غير مُنتج فقط بل يُسهم في تقدم سير العمل كذلك؟ هنا تأتي تقنية SAGE الجديدة، التي تقدم حلاً مبتكراً لهذه المشكلة.

SAGE، والتي تعني "التقييم المدعوم بحالة العمل" (State-Grounded Abstention-Aware Evaluation)، تعتمد على تجميع مواصفات سير العمل والفروق في الحالة من كل جولة لتقديم معايير دقيقة ومرتّبة. بدلاً من الاعتماد فقط على تقييم وحدات الذكاء الاصطناعي التقليدية (LLMs)، تستخدم SAGE مجموعة من المحققات الرمزية وآليات التحقق القائمة على مختلف التقنيات، مما يمكّنها من اتخاذ قرارات مدروسة بدلاً من الافتراض.

تقدم SAGE-CORE، نسختها الأساسية، أداءً رائعًا، حيث تحقق نسبة نجاح تصل إلى 81-91% من معايير التقييم دون الحاجة لأي تكلفة على نماذج LLM، مقارنة بتكاليف كبيرة تصل إلى 8 دولارات لكل 1000 جولة في بعض الأنظمة التقليدية مثل GPT-4.1. تعتمد SAGE على استخدام تقنيات منخفضة التكلفة، مما يجعلها خيارًا مثاليًا لمن يسعى لتقليل التكاليف وزيادة الكفاءة.

الأبحاث التي أُجريت تُظهر أن SAGE-Core تتفوق في جميع الاختبارات مقارنة مع النماذج التقليدية، مما يخبرنا بأن الابتكار في الذكاء الاصطناعي ليس مجرد خيال، بل واقع يتطور باستمرار.

في النهاية، هل برأيك يمكن أن تُعيد SAGE تعريف طريقة تقييم الوكلاء الحواريين؟ شاركونا آراءكم في التعليقات!