في عالم الذكاء الاصطناعي، تعتبر المحادثات العاطفية تحديًا كبيرًا، حيث تحتاج إلى أكثر من مجرد استجابات سلسة. فعندما يتعلق الأمر بدعم المشاعر، يجب على المساعدين فهم وضع السائل وعواطفه، واتباع استراتيجية مناسبة للرد بطريقة إنسانية طبيعية. ومع أن نماذج اللغات الكبيرة (Large Language Models) قد تقدمت بشكل ملحوظ، إلا أن الأنظمة الحالية غالبًا ما تفتقر إلى التفكير الهيكلي المستند إلى علم النفس.
تعاني هذه الأنظمة أيضًا من صعوبة تعزيز قدراتها عبر التعلم المعزز بسبب إشارات المكافأة غير الموثوقة، بالإضافة إلى أن عمليات التحسين في التعلم المعزز يمكن أن تعزز أنماط الرد المتكررة.
تقدم الدراسة الحالية نموذج PEER، الذي يعتمد على التفكير التعاطفي الهيكلي، والذي يقسم الدعم إلى ثلاث خطوات رئيسية: تحليل تاريخ المحادثات، استنتاج الحالة العاطفية متعددة الوسائط، واختيار الاستراتيجية، قبل توليد الرد النهائي. ولتنفيذ ذلك، تم تقديم مجموعة بيانات SER، التي تحتوي على تسميات دقيقة على مستوى الخطوات وتفضيلات الردود المتقابلة.
يستفيد نموذج PEER من عملية GRPO (General Reinforcement Process Optimization) مع نموذج مكافأة UnifiReward، وهذا النموذج موحد لتقييم خطوات التفكير والاستجابات النهائية أثناء التفاعلات متعددة الأدوار (multi-turn interactions). ولتقليل التكرار، تم تعزيز البيانات عبر إعادة كتابة قائمة على الشخصية وتقليل الوزن على المخرجات المكررة.
تُظهر التجارب الشاملة المُنفذة تحسنًا في التعاطف، وتوافق الاستراتيجيات، وطبيعة الإنسانية في الردود، دون التضحية بالتنوع. يمكنكم الاطلاع على كود النموذج وبياناته عبر الرابط github. في النهاية، يفتح هذا النموذج آفاقاً جديدة في التعامل مع المحادثات العاطفية وتقديم الدعم المطلوب بطريقة أكثر إنسانية.
نموذج PEER: نموذج مبتكر للتعلم المعزز لفهم التعاطف في المحادثات العاطفية
يقدم نموذج PEER نهجاً جديداً للتعلم المعزز الذي يركز على تعزيز التعاطف في المحادثات. يعتمد النموذج على خطوات هيكلية لتحليل المحادثات واستنتاج الحالات العاطفية، مما يحقق تفاعلات أكثر إنسانية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
