في عالم الذكاء الاصطناعي، حيث تتزايد استخدام نماذج اللغة الكبيرة (Large Language Models) كوكيل مستقل يتفاعل مع الويب عبر المتصفحات، يظهر تحدٍ جديد يتمثل في قياس قدرتها على إتمام المهام بنجاح. على الرغم من التقدم الذي تحقق مؤخراً، فإن المعايير الحالية غالباً ما تتجاهل اثنين من المصادر الأساسية للصعوبات: التفاعلات المعقدة على واجهات المستخدم الغنية والإدراك البصري للمحتوى المعروض بشكل ديناميكي.

هنا يأتي دور معيار CAP الجديد، الذي يُعد معيارًا قابلًا للتوسع لتقييم وكلاء المتصفح في مهام الويب التي تتطلب تفاعلات إنسانية معقدة وفهم بصري. يعتمد هذا المعيار على نظام تفكيك وإعادة تركيب يهدف إلى تحويل كل موقع ويب إلى بطاقة موقع منظمة، تسجل الوظائف المتاحة للمستخدم، والعمليات التنفيذية المعقدة، ومتطلبات الإدراك.

عبر هذا النظام، تم تطوير 420 مهمة عبر 108 موقعًا حقيقيًا و24 مجالًا تحت مراقبة جودة دقيقة، مما يوفر أساسًا قويًا لتشخيصات دقيقة. ومع استخدام نموذج الوكيل كقاضي (agent-as-a-judge)، تبين أن نسبة النجاح كانت منخفضة، مما يعكس الفجوة الكبيرة بين وكلاء المتصفح الحاليين ومتطلبات تصفح الويب في العالم الحقيقي.

هذا الابتكار يفتح آفاقًا جديدة لفهم التحديات التي تواجه وكلاء المتصفح، ويؤكد ضرورة تحسين قدراتهم لتلبية احتياجات المستخدمين الذين يتفاعلون مع المحتوى الديناميكي في بيئات متعددة.