في عالم الذكاء الاصطناعي، تواجه النماذج التحديات بشكل دائم، خاصة عند الانتقال من التفكير القصير إلى الطويل السياق. هنا تأتي تقنية SimpleOPD (Simple Tokenizer-Agnostic On-Policy Distillation) لتحدث ثورة في كيفية نقل قدرات التفكير. هذا الحل يعتمد على الفرضيات القوية لنقل قدرات النماذج المدرسية الأقوى إلى النماذج التي تعمل في سياقات أقصر.

إن أحد أكبر العقبات كان الفجوة بين النماذج في استخدام رموز مختلفة (tokenizers) وما ينتج عنها من عدم تطابق في التوزيع بين المدرس والطالب. وقد وجدت الدراسات أن هذه الفجوة قد تؤدي إلى استجابات طويلة جداً، مما يجعل التدريب غير مستقر.

الهدف هنا هو نقل قدرات التفكير من النموذج القوي SU-01 إلى نماذج مختصرة، مما يتطلب إدارة دقيقة للاختلافات بين الرموز. توصل الباحثون إلى طريقة مبتكرة تتمثل في العمل في مساحة نصية مشتركة، مما يجعل رموز الطالب تتماشى مع تلك الخاصة بالمدرس، وهو ما يسمح بتحقيق نتائج أفضل.

أظهرت التجارب على نماذج مختلفة مثل Qwen3 وQwen3.5 وIntern-S2 وGLM-4.7 تحسناً ملحوظاً في قدرات التفكير الرياضي، ولا سيما في إثباتات الرياضيات الطبيعية. الأرقام تتحدث عن نفسها، حيث حقق نموذج Intern-S2-Preview زيادة تصل إلى 21.2 نقطة في اختبار ProofBench، متجاوزاً بذلك نموذج Gemini-2.5-Pro.

إن هذه التطورات لا تعزز فقط من القدرة الرياضية، بل تشير أيضاً إلى أن تقنية OPD يمكن أن تنقل قدرات التفكير لتشمل مجالات أكثر اتساعاً من المعايير الرياضية، مما يقدم آمالاً جديدة لمستقبل الذكاء الاصطناعي.