في خطوة جريئة نحو تعزيز قدرات وكالات الذكاء الاصطناعي، تم إطلاق معيار Telco-GAIA، الذي يعد إنجازاً بارزاً في تقييم وكلاء الذكاء الاصطناعي ضمن مجال الاتصالات. يتضمن Telco-GAIA مئة مهمة تم التحقق منها من قبل البشر، والتي تتطلب قدرة على معالجة المعلومات بفهم عميق، حيث يقدم أسئلة بلغتين: الإنجليزية والعربية.

الجدير بالذكر أن هذه المهام تتطلب من الوكلاء القيام باستنتاجات متعددة الخطوات، بمتوسط 4.2 خطوات، وتتطلب الوصول إلى معلومات من ثلاثة مصادر غير متجانسة: لقطة لموقع ويب ثابت، قاعدة بيانات SQL مُصنَّعة، وأرشيفات ويب خارجية تشمل نصوص وصور وجداول.

تم تصميم Telco-GAIA بشكل يوفر بيئة اختبار محكمة قائمة على Docker، مما يجعل عمليات التقييم موضوعية وقابلة للتكرار عبر الزمن دون الحاجة للرجوع إلى LLMs كقضاة. أثبتت النتائج أن Telco-GAIA يمثل تحدياً كبيراً، حيث تمكن حتى أقوى نماذج الذكاء الاصطناعي من حل 71% فقط من المهام. ويظهر التحليل أن النماذج تُواجه عقبات كبيرة في فهم المستندات والصور، حيث كانت نسبة النجاح في الفئات البصرية أقل من 30%.

يمكن اعتبار Telco-GAIA بمثابة منصة صارمة وموثوقة لتقييم الوكلاء في المؤسسات، وكنموذج لبناء معايير خاصة بالقطاعات المغلقة، مما يسهل من فهم كيفية عمل وكالات الذكاء الاصطناعي في سيناريوهات حقيقية.