في عالم الذكاء الاصطناعي المتطور، يأتي مفهوم “إعادة التعلم الذاتي المتزامن” (On-policy Self-Distillation) ليحدث نقلة نوعية في تحسين القدرات الاستدلالية لنماذج اللغة الكبيرة (Large Language Models) عن طريق الدمج الداخلي للسياق المتميز في معلمات النموذج. تعتمد هذه الآلية الجديدة على مجموعة من الأبحاث الحديثة التي تهدف إلى تحسين التعلّم الذاتي بشكل فعال، حيث يتم اختيار الرموز (tokens) التي يجب التعلم منها، بالإضافة إلى التحكم في مقدار المعلومات المتميزة التي يتلقاها المعلم.
ومع ذلك، تظهر بعض التحديات، حيث كل من هذين الخطين البحثيين يقوم بتحسين متغير واحد مع الاحتفاظ بالآخر ثابتاً، مما يؤدي إلى حلول غير مثلى. في هذه الورقة، نوضح أن كلا المتغيرين مرتبطان بسعة تعلم الطالب، حيث يقوم السياق المتميز بتحديد اختلاف الرموز الذي يحدده المعلم، بينما يقوم وزن الرموز باختيار ما يجب على الطالب استيعابه.
نحن نقدم إطاراً موحداً للاستخدام في تحسين عملية التعلم، مما يزيد من تباين الطالب - المعلم، مع مراعاة ميزانية صعوبة التعلم التي يمكن أن يستوعبها الطالب. ومن خلال هذا النموذج، نقترح خوارزمية “إعادة التعلم الذاتي المتزامن الموحد” (Unified On-Policy Self-Distillation) المعروفة بـ (USD)، وهي خوارزمية خفيفة تعمل على حل معادلة Lagrangian.
تكشف خوارزمية USD أن متغيراً ثنائياً وحيداً يحكم كلا القرارين: عند سعر واحد لصعوبة التعلم، تحدد في الوقت نفسه عتبة اختيار الرموز واتجاه ضبط المعلومات المتميزة، مما يحافظ على توافق الإشراف مع قدرة الطالب المتطورة.
عبر تجارب شاملة، أثبتت خوارزمية USD أداءً متفوقاً على نماذج OPSD ومقاربات الوزن على مستوى الرموز والمعلومات المتميزة، وذلك عبر مقاييس استدلال متنوعة لمقاييس نموذج مختلفة. يمكنكم الاطلاع على الشيفرة البرمجية المتاحة على GitHub.
إعادة صياغة الذكاء الاصطناعي: إطار موحد لتحسين قدرات التعلم لدى الطلاب
تستعرض الورقة البحثية الجديدة آلية مبتكرة لتحسين قدرات نماذج اللغة الكبيرة من خلال إعادة التعلّم الذاتي المتكاملة. تتمثل الفكرة في تحسين عملية التعلم عبر توافق السياق المتميز مع سعة تعلم الطالب.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
