ما هو ADeptS-Bench؟
يستند ADeptS-Bench إلى إطار قدرات ADEPTS ودراسات مستخدمين من فئات عامة، حيث يتضمن دفقين رئيسيين:
1. **دفق الأمان**: يقدم مهام ضارة وغير ضارة تحتوي على تهديدات مدمجة في الواجهة.
2. **دفق التوضيح**: يقيم ما إذا كان الوكلاء يسعون للحصول على توضيحات حين تكون النوايا غامضة.
خلال التقييم لسبعة نماذج، وُجد أن لا نموذج يحقق نجاحًا متواصلًا يتجاوز 80% في المهام، بينما يبقى النجاح في التهديدات أقل من 30%. المفاجأة كانت عندما ضغط كل نموذج على زر "تأكيد" لطلب بقيمة 25,000 دولار دون تردد، دون أن يدرك أن زر "إعادة ضبط المصنع" قد تم تسميته بشكل خاطئ على أنه "تحسين".
الأطر المختلفة للسلامة
كشفت التحليلات عن ثلاث هياكل أمان متميزة:
- **اعتماد كامل على الأدوات** (+21-23 نقطة دون أداة الرفض).
- **اعتماد جزئي على الأدوات** (+10-11 نقطة).
- **عدم وجود آلية** (بدون تغيير).
وعند النظر في دفق التوضيح، أظهرت جميع النماذج ميلًا مبالغًا فيه في تقدير خطورة العواقب، مما يعكس انحياز الرفض المبالغ فيه الذي تم ملاحظته في مجال السلامة.
تم الإفراج عن جميع البيانات وكود التقييم وأدوات التحليل عند النشر، مما يمكّن الباحثين من تعزيز الفهم حول أداء هذه الوكلاء الرقميين.
توجه للمستقبل
بفضل هذه النتائج، يواجه المطورون تحديًا كبيرًا: تحسين الوكلاء الرقميين بحيث يمكنهم التعامل بأمان مع المهام التقنية المعقدة.
هل تعتقد أن مثل هذه المعايير ستغير مستقبل التعامل مع الوكلاء الرقميين؟ شاركونا آرائكم في التعليقات.
