في عالم الذكاء الاصطناعي، يُعد تدقيق التعلم (Supervised Fine-Tuning - SFT) أحد العناصر الأساسية في تحسين أداء النماذج. ومع ذلك، تظهر الأبحاث أن المعاملة الموحدة لكل الرموز قد تؤدي إلى تأكيد ملكية الرموز التي تم إتقانها مسبقًا، مما يزيد من الضغط على الرموز التي تفتقر إلى الثقة، وبالتالي يسبب ديناميكيات تدريب غير مثالية.

في دراسة جديدة، تم تقديم مبدأ Trimmed Logit-Gap SFT (TrimSFT)، وهو طريقة بسيطة لإعادة وزن الرموز تعتمد على الفجوة اللوجيت (Logit Gap) بين الرمز المعتمد وأقوى منافس له. هذا الطرح يركز التعلم ضمن منطقة وسطى بين الرموز المعتمدة وضعيفة الدعم.

تُعرض فكرة TrimSFT من خلال استخدام وزن غاوسي مركز على الهامش (margin) مع عرض (bandwidth) يُسمى { au}، مما يلغي الحاجة إلى نموذج مرجعي أو عملية انسيابية إضافية. تم تقييم هذا الأسلوب على ستة نماذج أساسية من عائلات Llama وQwen وDeepMath عبر خمسة معايير للتفكير الرياضي.

أثبتت النتائج أن TrimSFT يتفوق بشكل مستمر على SFT التقليدي، حيث حقق أفضل أداء متوسط في خمسة من بين ستة نماذج، مع تحقيق مكاسب تصل إلى +26.9 نقطة على MATH500.

تحليل أعمق يظهر أن عرض { au} يعد أكثر أهمية من موقع الهامش الدقيق، وأن الصيغ النصفية التي تزيل ضغط الإشراف من جانب واحد فقط تنتج توازنًا أقل فعالية. تشير التحليلات الإضافية لتوزيع الفجوة اللوجيت على مستوى الرموز إلى أن TrimSFT يعيد تشكيل ثقة النموذج بشكل أكثر توازنًا مقارنة بطرق SFT الموحدة أو طرق الإعادة الترجيحية الأحادية.

هذه النتائج توضح أن تحسين التعلم في مجال التفكير الرياضي يمكن أن يستفيد من تقليص التعلم على كلا الطرفين، بدلاً من معاملة جميع الرموز بشكل موحد.

ما هي آرائكم حول هذه الاستراتيجية المبتكرة؟ شاركونا أفكاركم في التعليقات.