كشف باحثون حديثًا عن نظام جديد يُطلق عليه "ناقد-إنف" (NAQD-Env) والذي يمثل معيارًا مبتكرًا لتقييم كيف يمكن لوكلاء اللغة (Language Agents) التعامل مع التغيرات في المهام. في عوالم الذكاء الاصطناعي، يحتاج العملاء إلى القدرة على مراجعة تصرفاتهم عندما تتغير الظروف أو تُلغى الأذونات. يساهم هذا النظام الجديد في تقييم مدى قدرة الوكلاء على تنفيذ الاستجابات الانتقائية، أي تعليق الإجراءات المتأثرة، مع الحفاظ على الأعمال غير المتأثرة واستئنافها بعد اصلاح المشكلات.

يتضمن "ناقد-إنف" أدوات تقييم فعالة تتيح مقارنة القرارات مع سياسات مرجعية محددة، حيث يقيم 11 عائلة من الاعتماديات على مجموعة من الهياكل التطويرية. تم إجراء الاختبارات على ثلاثة نماذج تعليمية ذات أوزان مفتوحة تحت ثلاث ظروف من الموجهات، مما أسفر عن نتائج مثيرة للاهتمام. على الرغم من أن دقة السحب لم تتعدى 0.06، إلا أن النموذج عرف تحسينًا كبيرًا في دقة اتخاذ القرارات بعد تعديلات إشرافية دقيقة، حيث ارتفعت دقة النموذج Qwen2.5-3B من 0.45-0.54 إلى 0.83-0.92.

تظهر النتائج أهمية تقييم السحب الانتقائي كعنصر خاص من موثوقية الوكلاء، مما يمهد الطريق لتطبيقات مستقبلية أكثر فعالية في هذا المجال. تبقى التحديات قائمة، سواء من حيث التحقق من القدرة على احتواء المصدر أو التأكيد على التطبيقات الواقعية.