في عالم الذكاء الاصطناعي، يعتمد التوافق بين نماذج اللغة والقيم البشرية بشكل رئيسي على البيانات المتعلقة بتفضيلات البشر. في تحليل حديث، عرض باحثون من Ge et al. (2024) دراسة مثيرة حول كيفية تحسين المكافآت الخطية (Linear Rewards) وتأثيرها على هذا التوافق. أظهرت الدراسة أن استخدام مكافآت خطية في اختيارات اجتماعية بسيطة يمكن أن يؤدي إلى فشل في تحقيق بعض القواعد الأساسية مثل حزمة التوافق (PO) والمعايير المحددة للتفضيل (PMC).

العنوان الرئيسي هو كيف يمكن تعزيز هذه القواعد على الرغم من هذا التحدي. يتناول الباحثون في دراستهم ضرورة وجود انحراف (slack) لكل مرشح، مما يسمح بتوزيع المكافآت بطريقة أكثر فعالية. وقاموا بحساب المكافأة الخطية المنقحة بأقل انحراف كلي يحقق المتطلبات، مع تحديد الفجوة المطلوبة بين قيمتين لمكافأتين مختلفتين.

تشير الأبحاث إلى أن الحدود العليا للانحراف الكلي هي O(1) عندما تكون الفجوة عند مستوى O(1/m^2) مع كثرة المرشحين. وقد أوضح الباحثون أيضًا كيفية رفع قيمة معامل الانحراف وضبطها للحصول على أقصى فعالية دون إضرار بالقيم الإنسانية.

لتأكيد هذه النظرية، تم إجراء تجارب على بيانات تفضيل حقيقية وصناعية، حيث أثبتت النتائج أن النموذج الجديد قادر على تجاوز نماذج المكافآت التقليدية. تعد هذه النتائج خطوة مهمة نحو تحسين نماذج الذكاء الاصطناعي بما يتماشى مع قيمنا الإنسانية الأساسية.