في ظل التطورات السريعة في نماذج اللغات الضخمة (Large Language Models) المدفوعة بأسلوب التعلم المعزز مع مكافأة قابلة للتحقق (Reinforcement Learning with Verifiable Reward - RLVR)، أصبحت هذه النماذج قادرة على أداء مهام معقدة بشكل مذهل. ومع ذلك، يرافق هذه القدرة المتزايدة ظهور علامات مثيرة للقلق تعرف بـ “انحراف اللغة”، مما يشير إلى استخدام لغة غير طبيعية أو غير منطقية في سلاسل التفكير (Chains of Thought - CoTs).

رغم توثيق انحراف اللغة بشكل جيد، إلا أن الأسباب التي تقف وراءه لا تزال غير مفهومة بشكل كاف. في دراسة حديثة، تم تحديد الظروف التي يحدث فيها انحراف اللغة، حيث أثبت الباحثون أن الضغط الناتج عن تحسين RLVR يمكن أن يؤدي إلى انحراف لغة غير محدود، في حين أن التعديل المتحكم فيه لا يؤدي إلى ذلك.

كذلك، أظهرت الأبحاث أن انحراف اللغة يحدث تحديدًا خلال المهام الجديدة عندما لا يمكن استنتاج السلوك المستهدف من النموذج الأساسي. وبالتالي، تشير النتائج إلى أنه لا يمكن السيطرة على انحراف اللغة دون تقليل المكافآت المتوقعة، مما يعني أن تحسين قابلية المراقبة لـ CoTs قد يؤثر سلبًا على الأداء أثناء عملية التعلم المعزز بعد التدريب.