تُعد عملية تكيف المهام بعد التدريب آلية رئيسية في تكييف نماذج اللغة الضخمة (Large Language Models) لتناسب المهام الخاصة. ومع أن الأبحاث السابقة تشير إلى أن تكيف المهام يمكن أن يؤثر على التوافق المسبق للنموذج، خاصة فيما يتعلق بسلوك الأمان، إلا أن تأثيراته الأوسع لا تزال غير مفهومة بشكل جيد. تهدف هذه الدراسة إلى معالجة هذه الفجوة من خلال تقييم منهجي لطرق تكيف المهام المع代表ة، مثل إعادة التدريب المراقب (Supervised Fine-Tuning - SFT)، وتعديل KL في SFT، والتعلم المعزز مع مكافآت قابلة للتحقق (Reinforcement Learning with Verifiable Rewards - RLVR) عبر 15 جانبًا من جوانب التوافق في ستة مجالات رئيسية: الأمان، والحقائق، وثبات الموقف، والأذى الاجتماعي، والقابلية للتحكم، والتعليم.

تظهر النتائج أن التكيف بعد التدريب لا يعيد تشكيل التوافق بشكل موحد. بينما يعمل RLVR على تحسين أداء المهام مع تسبب تغيرات صغيرة ولكنه غير صفري في القياسات المحددة، ينتج عن SFT انحراف كبير في التوافق عبر المجالات. كما يخفف تعديل KL من هذا الأثر: حيث أن التأصيل الأقوى للنموذج المرجعي يقلل من انحراف التوافق من القاعدة، على الرغم من أن KL-SFT لا يزال دون مستوى RLVR في الحفاظ على التوافق. تدعم التحليلات على مستوى التمثيل هذا النمط، حيث تتبع تغييرات التمثيلات ذات الصلة بالتوافق الانحراف السلوكي. مجتمعة، تُظهر هذه النتائج أن تكيف المهام ليس مجرد خطوة لتحسين القدرة، بل هو تدخل في التوافق بحد ذاته، مما يجعل التقييم متعدد الأبعاد للتوافق جزءًا أساسيًا من خطط ما بعد التدريب.