في ظل التطورات السريعة في نماذج اللغات الضخمة (Large Language Models) المدفوعة بأسلوب التعلم المعزز مع مكافأة قابلة للتحقق (Reinforcement Learning with Verifiable Reward - RLVR)، أصبحت هذه النماذج قادرة على أداء مهام معقدة بشكل مذهل. ومع ذلك، يرافق هذه القدرة المتزايدة ظهور علامات مثيرة للقلق تعرف بـ “انحراف اللغة”، مما يشير إلى استخدام لغة غير طبيعية أو غير منطقية في سلاسل التفكير (Chains of Thought - CoTs).
رغم توثيق انحراف اللغة بشكل جيد، إلا أن الأسباب التي تقف وراءه لا تزال غير مفهومة بشكل كاف. في دراسة حديثة، تم تحديد الظروف التي يحدث فيها انحراف اللغة، حيث أثبت الباحثون أن الضغط الناتج عن تحسين RLVR يمكن أن يؤدي إلى انحراف لغة غير محدود، في حين أن التعديل المتحكم فيه لا يؤدي إلى ذلك.
كذلك، أظهرت الأبحاث أن انحراف اللغة يحدث تحديدًا خلال المهام الجديدة عندما لا يمكن استنتاج السلوك المستهدف من النموذج الأساسي. وبالتالي، تشير النتائج إلى أنه لا يمكن السيطرة على انحراف اللغة دون تقليل المكافآت المتوقعة، مما يعني أن تحسين قابلية المراقبة لـ CoTs قد يؤثر سلبًا على الأداء أثناء عملية التعلم المعزز بعد التدريب.
اكتشاف سر انحراف اللغة في نماذج التعلم المعزز للغة!
تتناول دراسة حديثة انحراف اللغة في نماذج اللغات الضخمة (LLMs) وتقدم فهماً جديداً للأسباب التي تجعل هذه النماذج تتحدث بلغة غير متوقعة. تكشف الدراسة أن ضغط التحسين عبر التعلم المعزز له آثار عميقة على دقة الأداء.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
