في مجال تفاعل الإنسان مع الروبوت (Human-Robot Interaction)، يعتبر تعلم نموذج المكافأة الذي يمثل تفضيلات البشر تجاه سلوك الروبوتات من القضايا الجوهرية. تتضمن العملية التقليدية ثلاث مراحل رئيسية: أولاً، يقوم الروبوت بجمع أدلة مباشرة محدودة من التغذية الراجعة البشرية، مثل التعليقات الإيجابية أو السلبية. بعد ذلك، يستخدم الروبوت هذه الأدلة المباشرة لاشتقاق تسميات مقبولة أو مرفوضة للأفعال التي لم تُختار، وفقاً لقواعد ثابتة. وأخيراً، يُحدث الروبوت نموذج المكافأة باستخدام كلاً من الأدلة المباشرة والمشتقة.

ومع ذلك، فإن استخدام القواعد الثابتة قد يعيق عملية تعلم التفضيلات. في دراسة علمية تتعلق ببيئتين تعاونية، أظهرت النتائج أن التسميات التي قدمها البشر غالباً ما تختلف عن القواعد الثابتة المعمول بها، ولكن استخدام التسميات البشرية حقق تحسناً كبيراً في تعلم المكافآت باستخدام خوارزمية تعلم التفضيلات من التغذية الراجعة الضمنية والصريحة (Preference Learning from Implicit and Explicit Feedback - PIE).

نتيجة لذلك، تم اقتراح طريقة جديدة تُدعى IMPLIED، وهي نهج لنمذجة الاستدلال يعامل القواعد الثابتة كدليل أولي، بينما يتعلم استنتاج ومراجعة التسميات المقبولة والمرفوضة على مر الزمن. وعبر تقييمات على مسارات تفاعل إنسان-روبوت مسجلة ودراسة للروبوت أثناء صناعة البيتزا، أظهرت تقنية IMPLIED دقة أعلى في توقع الاستدلالات البشرية مقارنة بالنهج القائم على القاعدة الثابتة وأساسات نماذج اللغة الكبيرة (Large Language Models - LLM)، ملامسةً أداء نموذج تسميات من البشر.

هذا التحسين في عملية التعلم يؤدي إلى تقليل أخطاء تقدير التفضيل ويجعل سلوك الروبوتات أكثر عقلانية فيما يتعلق بمكافأة مركبة تتضمن المكافأة الصحيحة للمفضلاتف والمكافأة الخاصة بالمهمة. من خلال تعلم كيفية التفكير في الاستدلالات المتعلقة بالتغذية الراجعة البشرية، يساهم هذا العمل في تمكين الروبوتات من التكيف بشكل أكثر وفاءً وكفاءة خلال التعاون مع البشر.