في تطور جديد في عالم الذكاء الاصطناعي، أثبتت دراسة حديثة قوة تقنية التعلم الآلي المعتمدة على معلمين متعددين في تعزيز أداء نماذج اللغات الكبيرة (Large Language Models). تركز هذه التقنية، المعروفة باسم تحسين تدريس متعدد المعلمين (Multi-Teacher Self-Distillation Policy Optimization - MT-SDPO)، على استخدام تقنيات مبتكرة لتوجيه كل نموذج ضمن نطاق معين.

يشمل هذا النهج ثلاثة عناصر رئيسية: 1) الرؤوس الذاتية (self-anchors) التي تضمن توجيه النموذج بواسطة أمثلة صحيحة من نفس المجموعة، 2) أهلية التحقق من الإجابات (answer-verified eligibility) التي تسمح للمعلم بالتحقق من مصداقية الإجابة قبل تقديم التوجيه، و3) تقطير متميز (privileged distillation) الذي يجمع بين التعليقات المعتمدة وبيانات المراجعة لتوفير سياق شامل للنموذج.

من خلال تطبيق MT-SDPO، تمكن الباحثون من رفع درجات أضعف المجالات في نموذج Qwen3-8B بمقدار 14.79 نقطة وتقليص الفجوة بين المجالات بنسبة 74.7%. هذه النتائج تمتاز بأنها تفوق ما يمكن تحقيقه من خلال الاستعانة بمعلم واحد مطابق لكل مجال، مما يؤكد أن المصداقية يجب أن تتجاوز الانتماء إلى مجال معين.

إذا كنت مهتمًا بالتطورات الجديدة في الذكاء الاصطناعي وكيفية تأثير ذلك على تقنيات التعلم الآلي، احرص على متابعة المزيد من الدراسات المستقبلية حول MT-SDPO ونجاحاته في تحسين الأداء والنقل المعرفي بين المجالات.