يشير مفهوم التعلم الذاتي القائم على السياسة (On-policy self-distillation - OPSD) إلى قدرة نموذج واحد على العمل كطالب ومعلم في سياقات مختلفة. هذه التقنية أثبتت نجاحها في مجالات معينة مثل الرياضيات، حيث تُعد الإجابات الصحيحة من المعلومات المميزة التي تساعد على توجيه استمرارية النتائج بشكل كبير.

الآن، تمتد هذه الفكرة إلى مجال توليد المحتوى المفتوح، حيث يمكن استخدام المعايير (Rubrics) كوسيلة إرشادية. بدلاً من الاعتماد على إجابات قاسية ودقيقة، يمكن للمعايير توجيه التفضيلات مع السماح بعشرات الاستجابات الصحيحة.

لقد أظهرت الأبحاث أن استخدام المعايير كمعلومات مميزة (Privileged Information - PI) يوفر إشارة ثرية للتعلم بالمقارنة مع الأنظمة التقليدية. وعلى عكس ما قد يتوقعه البعض، فإن المعلومات المستندة إلى المعايير تؤدي إلى إشارات تدريب أكبر وأكثر فعالية لنماذج مثل غرفّة كوين (Qwen) ولما (Llama).

عند إجراء التجارب، أظهرت النتائج أن استخدام المعايير يحسن الأداء بشكل ملحوظ، حيث حققت زيادة تصل إلى 0.10 نقطة في التقييمات القصوى، متجاوزة تقنيات التعلم التقليدي.

كما تبين أن تأثير هذه النتائج يمتد لنماذج أخرى مثل RubricHub Science corpus، حيث أثبتت المعايير تفوقها على الطرق التقليدية، مما يفتح الأبواب لتحسينات جديدة في كيفية تدريب النماذج.