في ظل تطور الذكاء الاصطناعي (AI)، يبرز سؤال مهم: هل يمكن لوكلاء الذكاء الاصطناعي إتمام المهام اليومية عبر الإنترنت بكفاءة؟ لقد تم تطوير إطار تقييم جديد يُطلق عليه اسم كلو بنش (ClawBench)، والذي يُعد اختبارًا متقدمًا لمهارات هؤلاء الوكلاء في أداء مهام حقيقية يحتاج الأفراد إلى إنجازها في حياتهم اليومية.
يتناول كلو بنش 153 مهمة يومية تتضمن مجموعة واسعة من الأنشطة مثل إتمام عمليات الشراء، حجز المواعيد، وتقديم الطلبات الوظيفية، موزعة على 144 منصة مختلفة ضمن 15 فئة. هذه المهام تتطلب قدرات تفوق المعايير السابقة، مثل استخراج المعلومات ذات الصلة من الوثائق المقدمة من المستخدمين، والتنقل عبر عمليات متعددة الخطوات، وإجراء عمليات كتابة معقدة كملء النماذج بالتفصيل.
ما يميز كلو بنش هو أنه لا يُقيم الوكلاء في بيئات التعلم البيضاء (sandbox) التي تحتوي على صفحات ثابتة، بل يعمل على مواقع الويب الحقيقية، مما يحافظ على تعقيد الديناميكية والتفاعل الحقيقي. كما أن الإطار يتضمن طبقة اعتراضية تُحجب الطلبات النهائية للتقييم، مما يضمن عدم حدوث أي تأثيرات جانبية في العالم الحقيقي.
كشفت تقييمات أُجريت على 8 نماذج متقدمة أن كلا من النماذج الخاصة والمفتوحة المصدر تنجح في إتمام نسبة ضئيلة فقط من هذه المهام. على سبيل المثال، حقق نموذج كلود سونيت (Claude Sonnet) نسبة نجاح تصل إلى 33.3%، مما يُظهر الثغرات الموجودة في أداء الوكلاء الحاليين. إن التقدم في كلو بنش يقرّبنا خطوة من تحقيق وكلاء ذكاء اصطناعي يعملون كمساعدين عامين قادرين على التعامل مع المهام اليومية بكفاءة عالية.
ما رأيكم في استخدام الذكاء الاصطناعي لمساعدتنا في إنجاز مهامنا اليومية؟ شاركونا أفكاركم في التعليقات.
كلو بنش: هل تستطيع وكلاء الذكاء الاصطناعي إتمام المهام اليومية عبر الإنترنت بكفاءة؟
تم تقديم إطار تقييم جديد يُدعى كلو بنش، يتضمن 153 مهمة يومية تتراوح بين شراء المنتجات وحجز المواعيد. يقدم هذا الإطار اختبارًا واقعيًا لوكلاء الذكاء الاصطناعي لقياس أدائهم في بيئات شبكة الإنترنت الحية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
