في عالم الذكاء الاصطناعي، تلعب وكلاء التعلم المعزز (Reinforcement Learning) دوراً محورياً، لكن سلوكيات التعلم الخاصة بهم قد تكون غير مفهومة للناس. مما يؤدي إلى ردة فعل غير مثالية في سياقات التعليم المشترك. في دراستنا الأخيرة، استخدمنا نهجاً يستند إلى البيانات لفهم كيفية إدراك البشر لسلوكيات التعلم لدى الوكلاء.

أجرينا تجربتين لفحص هذا الأمر. ففي دراسة استكشافية شملت تسعة مشاركين، قمنا بتحديد أربعة موضوعات أساسية: أهداف الوكيل، المعرفة، اتخاذ القرار، وآليات التعلم. أما في الدراسة الموثوقة التالية التي شملت 34 مشاركاً، تم تطبيق نسخة موسعة من النموذج عبر مهمتين (التنقل/التلاعب) وخوارزميتين من التعلم المعزز (الجدول/تقريب الوظائف). التحليلات التي أجريت على 816 إجابة أكدت موثوقية النموذج وساعدت في تحسين الإطار الموضوعي، مما أظهر كيف تتطور هذه الموضوعات بمرور الوقت وتتداخل.

قدمت نتائجنا فهماً مركزياً للإنسان حول كيفية تفسير الأفراد لعمليات التعلم لدى الوكلاء. وهذا يفتح أمامنا آفاقاً جديدة في تصميم أنظمة التعلم المعزز القابلة للتفسير، مما يعزز الشفافية في التفاعل بين الإنسان والروبوت.