يواجه البحث في نماذج اللغة الضخمة (Large Language Models) تحديات جديدة في مرحلة التصحيح بعد التدريب، حيث يكشف التحليل الأخير عن وجود مشكلة معروفة باسم "عدم التطابق المتدهور" (degenerate agreement). في هذه الحالة، يقوم الطلاب باستغلال حلقات التكرار لتحقيق توافق شبه مثالي في الرموز مع المعلم، حتى في ظل وجود استجابات غير صحيحة بشكل عام.

لذا، تحول البحث إلى التوجه نحو عدم التطابق بين الطلاب والمعلمين، حيث تصنف رموز عدم التطابق إلى نوعين رئيسيين:
1. رموز الطلاب الزائدة (student-excess tokens): حيث تُنتج بواسطة الطالب لكن تُعطى احتمالية قريبة من الصفر من قبل المعلم، مما يؤدي إلى عدم استقرار التحديث.
2. رموز نقص الطلاب (student-deficit tokens): وهي الرموز المفضلة من المعلم ولكن نادراً ما يتم استخدامها من قبل الطالب، مما يعرقل نقل أنماط التفكير الخاصة بالمعلم.

لمعالجة هذه التحديات، اقترح الباحثون طريقة TIDE (Token-level Independent Deficit-Excess correction)، التي تستخدم تعديل هيلينجر المحكوم للحد من أقصى الزيادة المتكررة، وإعادة توزيع الاحتمالية المنقوصة دون الحاجة إلى معاملة الرموز الناقصة.

عبر مجموعة من اختبارات الحساب الرياضي مع أزواج المعلم والطالب Qwen3، أثبتت TIDE تفوقها الثابت على التقنيات التقليدية وطرق الاختيار الحديثة. بالإضافة إلى ذلك، كانت تحسيناتها أكثر وضوحًا عندما كان هناك عدم تطابق قوي بين الطلاب والمعلمين، حيث تمكنت من رفع متوسط الأداء من 6.9% إلى 20.3%، وتقليل متوسط طول الاستجابة بمعدل 3.6 مرات، بالإضافة إلى تقليل أخطاء التنسيق بشكل كبير.

لمن يرغب في استكشاف الشيفرة البرمجية، يمكن العثور عليها على GitHub.

أمام هذه التطورات المثيرة، كيف ترون تأثير تقنية TIDE ومستقبل تصحيح عدم التطابق في نماذج الذكاء الاصطناعي؟ شاركونا آراءكم في التعليقات!