في عالم الذكاء الاصطناعي، تزداد تعقيدات المعايير التقييمية التي تقيس أداء العملاء الآليين، لكن هل تساءلت يومًا عن من يراقب هذه المعايير نفسها؟ الأمر ليس بسيطًا كما يبدو. تشير الدراسات إلى أن العديد من تلك التي تبدو كإخفاقات للعملاء ليست منتجات أخطاء العملاء، بل هي أخطاء موجودة في المعايير التقييمية ذاتها.

يأتي نظام "BenchGuard" ليكون الحل المبتكر الذي يهدف إلى تحسين تدقيق هذه المعايير. كيف يعمل؟ من خلال استخدام نماذج اللغة الضخمة (Large Language Models) كمدققين نظاميين لبيئة التقييم. العامل الأبرز في نظام BenchGuard هو أنه يتيح تدقيقًا مشتركًا عبر جميع العناصر المرتبطة بالمعايير، كما يقوم بالتحقق المزدوج من صحة النتائج من خلال بروتوكولات منظمة خاصة بنماذج اللغة.

عند تطبيق BenchGuard على معيارين علميين بارزين، تم الكشف عن 12 مشكلة تم تأكيدها من قِبَل المؤلفين في معيار أماكن العلوم ScienceAgentBench، بما في ذلك أخطاء قاتلة تجعل المهام غير قابلة للحل. بالإضافة إلى ذلك، تطابق النظام مع 83.3% من المشكلات التي حددها الخبراء في مجموعة BIXBench Verified-50، وهي دلالة قوية على فعالية النظام.

الأخبار الجيدة هي أن تدقيق 50 مهمة معقدة في علم المعلومات الحيوية يكلف أقل من 15 دولارًا أمريكيًا، مما يجعل من التدقيق الآلي للمؤشرات أداة فعالة ومفيدة لتكمل المراجعات البشرية. كما أن التدقيق المبدئي بتنسيق محلي لبرنامج Bench يسجل نجاحًا آخر يؤكد إمكانية تطبيق النظام عبر تنسيقات مختلفة.

تطرح هذه النتائج زخمًا جديدًا لتطوير المعايير بمساعدة الذكاء الاصطناعي، حيث تخدم النماذج المتقدمة ليس فقط كمواضيع تقييم، بل أيضًا كأعضاء نشطين في عملية التحقق من صحة البنية التحتية الخاصة بالتقييم.