يشير مفهوم التعلم الذاتي القائم على السياسة (On-policy self-distillation - OPSD) إلى قدرة نموذج واحد على العمل كطالب ومعلم في سياقات مختلفة. هذه التقنية أثبتت نجاحها في مجالات معينة مثل الرياضيات، حيث تُعد الإجابات الصحيحة من المعلومات المميزة التي تساعد على توجيه استمرارية النتائج بشكل كبير.
الآن، تمتد هذه الفكرة إلى مجال توليد المحتوى المفتوح، حيث يمكن استخدام المعايير (Rubrics) كوسيلة إرشادية. بدلاً من الاعتماد على إجابات قاسية ودقيقة، يمكن للمعايير توجيه التفضيلات مع السماح بعشرات الاستجابات الصحيحة.
لقد أظهرت الأبحاث أن استخدام المعايير كمعلومات مميزة (Privileged Information - PI) يوفر إشارة ثرية للتعلم بالمقارنة مع الأنظمة التقليدية. وعلى عكس ما قد يتوقعه البعض، فإن المعلومات المستندة إلى المعايير تؤدي إلى إشارات تدريب أكبر وأكثر فعالية لنماذج مثل غرفّة كوين (Qwen) ولما (Llama).
عند إجراء التجارب، أظهرت النتائج أن استخدام المعايير يحسن الأداء بشكل ملحوظ، حيث حققت زيادة تصل إلى 0.10 نقطة في التقييمات القصوى، متجاوزة تقنيات التعلم التقليدي.
كما تبين أن تأثير هذه النتائج يمتد لنماذج أخرى مثل RubricHub Science corpus، حيث أثبتت المعايير تفوقها على الطرق التقليدية، مما يفتح الأبواب لتحسينات جديدة في كيفية تدريب النماذج.
اكتشاف أسرار جديدة في توليد المحتوى: استخدام المعايير كأداة قوية!
تقدم دراسة جديدة مفهوم استخدام المعايير كأداة للزيادة من فعالية نماذج الذكاء الاصطناعي في توليد المحتوى المفتوح. من خلال تحسين عملية التعلم الذاتي، يمكن تحقيق نتائج مدهشة في مختلف المجالات.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←# On-policy Self-Distillation# التعلم الذاتي# Rubrics# نموذج Qwen# نموذج Llama# توليد المحتوى# Open-ended generation
جاري تحميل التفاعلات...
