في عالم الذكاء الاصطناعي، تُعتبر تقييمات الأداء الوكيل في واجهات المستخدم الرسومية (GUI) من القضايا المحورية. حيث يهدف التقييم إلى تحديد ما إذا كان الوكيل قد أكمل التعليمات بنجاح. مع تزايد أهمية تقييم المهام التلقائية (Automated Task Evaluation)، قدم بحث جديد مفهومًا رائدًا يُعرف بـ "العميل التفاعلي للمكافآت" (Interactive Reward Agent - IRA).

اعتمد العملي IRA على إطار "اقترح ثم تحقق". يقوم الوكيل أولاً باقتراح شروط الإكمال المهمة بناءً على التعليمات المُعطاة له، ثم يتحقق من تلك الشروط باستخدام أدوات النظام، وأدوات التطبيقات، بالإضافة إلى أدوات واجهة المستخدم. هذه العملية التفاعلية تجمع بين الأدلة المستمدة من الواجهات المرئية وحالات البيئة، مما يساعد في تحسين دقة التقييم.

جدير بالذكر أن البحث أتاح أيضًا إنشاء معيار جديد أطلق عليه "GUI-RewardBench"، والذي يتكون من 321 مسار مهمة بواجهات المستخدم الرسومية، ويغطي 10 فئات مختلفة من التطبيقات على نظام "Ubuntu". أظهرت التجارب التي أُجريت باستخدام IRA دقة تصل إلى 86.9%، ما يضعه في صدارة المنظومات الحالية لتقييم الوكلاء.

بفضل هذا النظام الجديد، أصبح من الممكن تقديم إشارات مكافأة فعالة لتدريب الوكلاء الذكيين، مما يساهم في تعزيز معدل النجاح في المهام بفارق كبير، حيث حقق IRA نسبة نجاح تصل إلى 34.0% في بيئات التدريب.

يعتبر هذا التطور خطوة مهمة نحو تحسين تقنية الذكاء الاصطناعي ودعم أداء الوكلاء في مهامها اليومية. لذا، كيف يمكن أن يؤثر هذا على مستقبل تفاعل الإنسان مع التكنولوجيا؟