في عالم الذكاء الاصطناعي سريع التطور، يبرز التحدي المستمر في كيفية توافق نماذج اللغات الكبيرة (LLMs) مع تفضيلات المستخدمين المتنوعة، والتي قد تكون متضاربة في بعض الأحيان. لقد قدم الباحثون مؤخرًا مفهومًا مبتكرًا يُعرف بـ "التوافق العالمي الاستاتيكي" (Asymptotic Universal Alignment) باستخدام أسلوب تصحيح أوقات الاختبار (Test-Time Scaling).

يعتمد هذا الإطار الجديد على تقديم عدد من الاستجابات من النموذج لكل استفسار، مما يتيح للمستخدم اختيار الاستجابة التي يفضلها. وقد تم تقديم مصطلح "التوافق المعزز" (k,f(k))-robust alignment)، حيث يتطلب من النموذج المخرج أن يكون له معدل فوز (win rate) معين مقابل أي نموذج مخرج واحد آخر.

الأبحاث تشير إلى أن معدل الفوز يجب أن يقترب من 1 كلما زاد عدد الاستجابات (k). وقد توصل الباحثون إلى أسرع طريقة لتحقيق توافق مثالي، حيث وجدت الدراسة أن بعض السياسات ذات المخرجات الأحادية يمكن أن تحقق التوافق العالمي بمعدل f(k)=k/(k+1).

ومع ذلك، يكشف البحث أيضًا أن الطرق الشائعة المستخدمة بعد التدريب، مثل التعلم من ردود فعل البشر (Nash Learning from Human Feedback - NLHF)، قد لا تستفيد بالكامل من فوائد تصحيح أوقات الاختبار. فعلى الرغم من أن NLHF يعد الأمثل عندما يكون k=1، إلا أن اختيار ردود الفعل الناتجة، والتي غالباً ما تكون حتمية، لا يمكنها ضمان معدلات فوز تفوق 1/2 إلا بفارق ضئيل.

تكمن المشكلة في عدم تنوع المخرجات، حيث أن الطرق الحالية يمكن أن تتقلص إلى استجابة واحدة مفضلة من قبل الغالبية، مما يجعل العينات الإضافية غير مجدية. في المقابل، يضمن إطار العمل الجديد الاحتفاظ بتنوع المخرجات وتحقيق معدل تصحيح أوقات الاختبار الأمثل.

في سياق ذلك، اقترح الباحثون مجموعة من الألعاب التعاونية المتعددة اللاعبين، وأثبتوا أن أي سياسة توازن ناش من اللعبة التي تتضمن (k+1) لاعبًا يمكن أن تحقق "التوافق المعزز" الأمثل. ويرافق هذا توفير ضمانات نظرية لانحدار تعلم الذات في هذه الألعاب، وتمتد الإطار ليشمل المنافسين الذين يولدون أيضًا ردود فعل متعددة.