في عالم الذكاء الاصطناعي، يعمل وكلاء البحث العميق (Deep Search Agents) على مسارات تتضمن العشرات من الخطوات، إلا أن التعلم المعزز التقليدي (Reinforcement Learning) يوفر مكافأة واحدة فقط عن كل مسار، مما يسبب صعوبة في تخصيص الاعتمادات بشكل فعال. تتصدى تقنية جديدة تدعى "التقليص الذاتي المعتمد على السياسات أثناء التنفيذ" (On-policy Self-Distillation) لهذه المشكلة من خلال استخدام نماذج الوكلاء كمدرسين لمستويات دلالية كثيفة.

ولكن تطبيق ذلك على وكلاء البحث أدى إلى توتر أساسي، حيث أن المعلم، الذي لديه وصول لمعلومات حصرية مثل الإجابة الصحيحة، ينتج توزيعًا يختلف بانتظام عن تفكير الطالب القائم على الاستكشاف. يؤثر ذلك سلبًا على اكتساب الطالب لاستراتيجيات بحث أفضل. لحل هذا التوتر، تم تقديم اسهامان رئيسيان:

الأول هو إنشاء "مراكز الأدلة" (Evidence Anchors)، وهي مقتطفات مختصرة من الأدلة على مستوى الخطوة مقتطفة من الإنترنت، حيث تلتقط خطوات التفكير الأساسية دون الكشف عن المسار الكامل للإجابة.

ثانيًا، اقترح الباحثون "تحسين السياسات ذات المستوى الخطوي" (Step-Level Self-Distilled Policy Optimization) الذي يحول عدم توافق المعلم والطالب إلى أوزان تفوق على مستوى الخطوة ضمن خوارزمية "GRPO"، وهو ما يستخدم حصرياً على المسارات غير الصحيحة.

تستند هذه التصميمات إلى فصل ما يجب تحديثه عن مقدار التحديث: تحدد المكافأة الناتجة اتجاه تغيير السياسة، بينما يحدث المعلم تعديلًا على المقدار في كل خطوة. تظل المسارات الصحيحة غير متأثرة، مما يحافظ على تنوعها.

وعلى نموذج "Qwen3-8B"، أظهرت تقنية SSPO أداءً متفوقًا باستمرار على "GRPO" عبر مجالات "BrowseComp" و"GAIA" و"FRAMES"، متجاوزة أو مساوية لأداء "GRPO" المدرب مع ضعف عدد خطوات التدرج، مع إضافة حوالي 5% فقط كعبء إضافي لكل خطوة نتيجة لمرور إضافة واحدة فقط.