في عالم الذكاء الاصطناعي، تتطلب المهام طويلة السياق تقنيات متطورة وفهمًا عميقًا للمشاكل المطروحة. في هذا السياق، تم تقديم تقنية جديدة تُعرف باسم Group-Calibrated On-Policy Distillation (GC-OPD) التي تُعالج المشاكل المرتبطة باستجابة نماذج التعلم العميق.

تعمل تقنية On-Policy Distillation (OPD) على تدريب نموذج "طالب" من خلال الاستفادة من ردود نموذج أقوى يُعرف بالمعلم. بالرغم من كفاءة OPD، إلا أن الدعم المحدد لكل رمز يمكن أن يؤدي إلى استجابات محلية مقبولة ولكنها تتجاهل الأدلة المهمة الموزعة عبر السياق أو تنتهك قيود المهمة العامة.

يمثل التحقق من المهام، الذي يقيم الإنجاز على مستوى الاستجابة، خطوة إيجابية، حيث يُعيد مكافآت مُدرجة تعكس النجاح الجزئي. لكن هناك تبين أن نقاط قياس OPD على مستوى المسار بدأت تبتعد عن تقييمات المُحقق، مما يشير إلى عدم توافق كبير بين المعلم والمُحقق.

استجابةً لهذا الأمر، تقدم GC-OPD آلية جديدة لضبط مكافآت المُحقق ونقاط OPD داخل كل مجموعة، مما يساعد على تقديم تحليل أكثر دقة للإجابات. من خلال هذا النهج، تحسنت متوسطات الأداء لنموذجي Qwen3-4B وQwen3-8B بشكل ملحوظ في خمسة معايير طويلة السياق.

هذه النتائج تشير إلى أن ضبط بقايا الإيجابية النسبية يمكن أن يتضمن نتائج المُحقق دون الاستغناء عن الإرشادات على مستوى الرمز. كل ذلك يُظهر تقدمًا كبيرًا في تحسين نماذج الذكاء الاصطناعي، مما يُبشر بمستقبلٍ واعد في هذا المجال.