في عالم الذكاء الاصطناعي، تُعتبر التقنيات المستخدمة في تحسين أداء النماذج محورية لتحقيق نتائج عالية ودقيقة. من ضمن هذه الابتكارات، تأتي تقنية جديدة تُعرف باسم 'خطوات التصحيح لمراقبة الأداء' (Step-Level On-Policy Distillation - SOPD)، التي تأخذ عملية التصحيح إلى آفاق جديدة.

تُعنى الطريقة الجديدة بتصحيح النماذج من خلال محاذاة النموذج التلميذ مع توزيع إشارات المعلم خلال مسارات النموذج التلميذ. وبينما أثبتت الطرق التقليدية قدرتها، فإن SOPD تقدم تحسينات ملحوظة.

تتمثل إحدى المشكلات الرئيسية في طرق التصحيح التقليدية بأنها توفر تصحيحات مجزأة على مسارات النموذج التلميذ، مما يُصعّب إنشاء مسار تصحيحي كامل وصحيح. وهنا تأتي SOPD لتجمع فوائد التصحيح الطويل الأمد من التعديل الخاضع للإشراف (Supervised Fine-Tuning - SFT) مع مزايا المراقبة المباشرة من OPD، وذلك من خلال توفير إشراف على مستوى الخطوة عبر المسارات التي ينتجها التلميذ.

أظهر البحث أن SOPD يمكن أن يُخفّض إلى SFT أو يقارب OPD عند حدود طول الخطوة المختلفة. وبالمقارنة مع الطرق التقليدية، تُعد ردود المعلم في SOPD مشروطة بمسارات التلميذ، مما يزيد من دقة التصحيحات مقارنة بالطرق الأخرى.

علاوة على ذلك، أثبتت SOPD تفوقها في مهام التفكير والاحتواء، حيث أظهرت نتائج مذهلة تتمثل في تحسين معدل النجاح بنسبة 13.4 نقطة مقارنةً بـ OPD التقليدي.

مع هذه التقنية المبتكرة، يأمل الباحثون في فتح آفاق جديدة للاستكشاف في مجال طرق التصحيح، مما يزيد من فعالية نماذج الذكاء الاصطناعي ويعزز من قدراتها في مواقف مختلفة.