في عالمنا الرقمي المتغير، تُمكّن النماذج الأساسية (Foundation Models) الوكلاء المستقلين من التفاعل مع المواقع الإلكترونية بطريقة فعّالة. ولكن، تبين أن المعايير الحالية تركز بشكل مفرط على التصفح العام، مما يؤدي إلى قلة تمثيل البيئات البحثية وعمليات اكتشاف المعرفة الأكاديمية.
لذا، جاءت منصة WebArxiv كحل مبتكر، حيث توفر معيارًا ثابتًا لاختبار قدرات الوكلاء في تنفيذ مهام أكاديمية متعددة. يشمل WebArxiv 510 مهمة زمنية ثابتة، مزودة بمعلومات دقيقة وموثوقة تتيح تجارب بحثية دون أي حساسيات للخصوصية.
تستفيد المهام المقدمة على WebArxiv من تنوع وواقعية عالية، تتجاوز مجرد البحث عن معلومات بسيطة، لتسلط الضوء على مهام استرجاع الأوراق تحت قيود متعددة، واستخراج المحتوى بدقة، ومقارنة الأوراق المختلفة.
علاوة على ذلك، أظهرت التقييمات لوكلاء الويب المعتمدين على النماذج الأساسية أن WebArxiv يبقى تحديًا حقيقيًا. وقد أظهرت التحليلات السلوكية أن الوكلاء يميلون إلى الاعتماد بشكل زائد على تواريخ التفاعل الثابتة، مما يؤدي إلى استنتاجات غير مكتملة أو متكررة. لذا، تم تزويدهم بآلية ذاكرة ديناميكية خفيفة للتكيف في الاسترجاع والتفكير.
يمكنك التعرف على المزيد من المعلومات حول المعايير والتكويد المتاح عبر هذا الرابط.
ما رأيكم في التطورات الجديدة في تقييم وكلاء الويب؟ شاركونا آرائكم في التعليقات!
WebArxiv: معيار ثوري لتقييم وكلاء الويب متعددة الوسائط عبر مهام arXiv!
تم إطلاق WebArxiv كمعيار مبتكر يوفر بيئة اختبار قابلة للتكرار لوكلاء الويب، ليعالج تحديات التفاعل مع المواقع الأكاديمية. مع 510 مهمة مميزة، يسهم هذا التطوير في تحسين التجارب البحثية بشكل ملحوظ.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
