في عالم التعلم الآلي، تبرز الحاجة إلى أساليب جديدة لرفع كفاءة النماذج المعقدة. يتركز هذا المقال على مفهوم "الإشراف الانتقائي" (Selective Supervision) في نموذج "التقطيع المباشر للسياسات" (Direct-OPD). يهدف هذا النموذج إلى نقل تحسينات السياسة التي تحققت من خوارزميات التعلم المعزز من نموذج صغير إلى نموذج أكبر، وذلك من خلال استخدام النسبة بين نقاط التحقق ما بعد التعلم وما قبله كإشراف كثيف على محاولات النموذج الكبير.
ومع ذلك، تكمن المشكلة في أن قياسات التحسين يمكن أن تظل ثابتة حتى في حالات تلاشي كثافة الاحتمالات المخصصة للرموز المختارة. من خلال دراسة محكمة، توصل الباحثون إلى أن مكافآت نموذج ".Direct-OPD" يمكن أن تبقى دون تغيير حتى مع تراجع بعض المقاييس. استلهم الباحثون من هذه النتائج لتقديم نموذج "الإشراف الانتقائي"، الذي يقوم بتصنيف الحالات المدروسة وفقًا لاختلاف أهلية المعلم ويقوم بإخفاء الإشراف في الحالات ذات الاختلاف المنخفض، مما يحتفظ فقط بأعلى 10% من الحالات لكل استجابة.
من خلال الاختبارات على مجموعتين من المعلمين وأربعة نماذج طلابية تتراوح بين 1.7 مليار إلى 8 مليارات معلمة، أظهر نموذج "S$^2$D-OPD" تحسينات ملحوظة في دقة الأداء عبر مجموعة من الاختبارات، من دون الحاجة لتكرار إضافي.
إذا كنت مهتمًا بالمزيد من التفاصيل التقنية، يمكنك زيارة الرابط المتاح لمصدر الشيفرة: https://anonymous.4open.science/r/S2D-OPD-8868.
اختيار الإشراف الذكي: كيف يمكن تحسين نماذج التعلم المعزز من خلال التقطيع الانتقائي
اكتشاف مجموعة من الحلول المبتكرة لتعزيز كفاءة نماذج التعلم المعزز عبر تقنيات الإشراف الانتقائي. المقال يستعرض كيفية تطبيق أساليب جديدة لتحسين دقة النماذج الكبيرة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
