في تطور جديد في عالم الذكاء الاصطناعي، أثبتت دراسة حديثة قوة تقنية التعلم الآلي المعتمدة على معلمين متعددين في تعزيز أداء نماذج اللغات الكبيرة (Large Language Models). تركز هذه التقنية، المعروفة باسم تحسين تدريس متعدد المعلمين (Multi-Teacher Self-Distillation Policy Optimization - MT-SDPO)، على استخدام تقنيات مبتكرة لتوجيه كل نموذج ضمن نطاق معين.
يشمل هذا النهج ثلاثة عناصر رئيسية: 1) الرؤوس الذاتية (self-anchors) التي تضمن توجيه النموذج بواسطة أمثلة صحيحة من نفس المجموعة، 2) أهلية التحقق من الإجابات (answer-verified eligibility) التي تسمح للمعلم بالتحقق من مصداقية الإجابة قبل تقديم التوجيه، و3) تقطير متميز (privileged distillation) الذي يجمع بين التعليقات المعتمدة وبيانات المراجعة لتوفير سياق شامل للنموذج.
من خلال تطبيق MT-SDPO، تمكن الباحثون من رفع درجات أضعف المجالات في نموذج Qwen3-8B بمقدار 14.79 نقطة وتقليص الفجوة بين المجالات بنسبة 74.7%. هذه النتائج تمتاز بأنها تفوق ما يمكن تحقيقه من خلال الاستعانة بمعلم واحد مطابق لكل مجال، مما يؤكد أن المصداقية يجب أن تتجاوز الانتماء إلى مجال معين.
إذا كنت مهتمًا بالتطورات الجديدة في الذكاء الاصطناعي وكيفية تأثير ذلك على تقنيات التعلم الآلي، احرص على متابعة المزيد من الدراسات المستقبلية حول MT-SDPO ونجاحاته في تحسين الأداء والنقل المعرفي بين المجالات.
تعلم من الأفضل: تقنية جديدة لدعم نماذج اللغات الكبيرة عبر تحسين متعدد المعلمين!
تمكنت دراسة جديدة من تحسين أداء النماذج اللغوية الضخمة من خلال نهج مبتكر يدمج خبرات معلمين متعددين. تقنية Multi-Teacher Self-Distillation Policy Optimization (MT-SDPO) تعيد تعريف كيفية استخدام التعلم المعزز لتحسين دقة النماذج.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
