في عالم يتطور بسرعة نحو الاعتماد على الذكاء الاصطناعي، أطلق الباحثون WebFovea، وكيل ويب معتمد على رؤية الكمبيوتر، حيث حقق إنجازًا ملحوظًا في تحدي WebRetriever 2026 بعد حصوله على score بلغت 57.0 من 100. هذا التحدي يركز على تقييم الوكلاء بشكل شامل وفقًا لبروتوكول III من معيار WebRetriever.

بداية، يجب أن يعمل هذا الوكيل من خلال URL مباشر لموقع ويب، ويتحتم عليه التفاعل مع واجهة الموقع الخاصة به لتقديم إجابة يمكن التحقق منها. ولتحقيق هذا الهدف، يتطلب الأمر نموذج لغوي كبير (Large Language Model) متعدد الأنماط، إلا أن هذا ليس كافيًا بمفرده.

تتداخل عمليات اتخاذ القرار في هذا النموذج عبر ما يسمى "الحزام"، وهو الكود الذي يربط بين النموذج والصفحة. ولكل عملية يجب أن تحدث أربع خطوات بنجاح: يجب أن يتم تحليل إجابة النموذج إلى الإجراء المفترض، وأن يؤثر هذا الإجراء بالفعل على الصفحة، وأن يتم الإبلاغ عن النتيجة بدقة، وأخيرًا يجب عرض المعلومات الضرورية على النموذج.

ومع ذلك، كشفت التجارب أن العديد من الفشل يحدث في إحدى هذه المراحل الأربعة بدلاً من التفكير المنطقي للنموذج. بعض التحديات تضمنت عدم تطابق المسافات بين الإحداثيات، حيث تم تسجيل كل نقرة في 3/4 الإحداثيات المقصودة، وفشل الإجراءات داخل القوائم المنسدلة أو في الإطارات (iframes) بدون تنبيهات.

مع ذلك، صُممت WebFovea لتقوية كل مرحلة مع الحفاظ على الوكيل ضمن الحدود ودون تجاوز الميزانية. وهذا التصميم يسهم في تحسين الأداء بشكل كبير، حيث حقق ارتفاعًا ملحوظًا في score منذ استخدام نفس النموذج عبر جميع الاختبارات.

تعتبر التحسينات التي تم إدخالها على "الحزام" والنتائج السلبية بمثابة دليل على وجود اهتمام كبير بفهم الصعوبات التي تواجه التفاعلات الحقيقية على الإنترنت. تتمثل الرؤية المستقبلية في توجيه خطوات مختلفة إلى نماذج مختلفة، مما يتيح تحسين الأداء الشامل.

إن WebFovea يمثل خطوة مثالية نحو تحقيق تفاعلات أكثر ذكاءً وفعالية مع المواقع الإلكترونية، الأمر الذي قد يُحدث فارقًا كبيرًا في تجربة المستخدمين.