في عالم يتجه بسرعة نحو الرقمنة والذكاء الاصطناعي، يسعى الباحثون باستمرار لتحسين أنظمة التعلم الآلي. وبالتحديد، ركزت دراسة جديدة صدرت مؤخرًا، تحت عنوان "RISE: تحسين متكرر عبر تقنيات استخراج السياسة الذاتية"، على إطلاق قدرات ملحوظة لنماذج اللغة. تعتبر تقنيات "التصريف على السياسة" (On-policy distillation) أداة قوية لتقديم إشراف كثيف لكل رمز في مرحلة ما بعد تدريب نماذج اللغة، ولكن فعالية هذه الطريقة غالبًا ما تتعثر بسبب جودة المعلم. فالمعلمون الخارجيون غالبًا ما يواجهون عدم تطابق في التوزيع، بينما تعتبر التقنيات الذاتية محدودة بسبب القدرة على التعلم في سياق معين.

لذا، قدم الباحثون تقنية RISE، التي تقدم حلاً مبتكرًا من خلال بناء معلم اصطناعي ينشأ مباشرة من مسار تدريب النموذج نفسه. تستخدم تقنية RISE خوارزمية تستفيد من التغير بين نقطة التحقق الحالية ومرجع متأخر من أجل تحويل تحديث المعلمات الأقل تأثيرًا إلى هدف كثيف على مستوى الرموز. هذا يعني أن RISE تدمج تقنيات التعلم القائم على المكافأة مع التصريف على السياسة في حلقة متكاملة، مما يعزز القدرة على اتخاذ القرارات على مستوى الرموز.

تُظهر تجارب التقنيات الجديدة والتي شملت التساؤلات الرياضية، وعلوم التقنية متعددة المجالات، وخلق الأكواد، ومهام الوكالة المتعددة الأدوار، أن RISE تتفوق بجدارة على الأساليب التقليدية مثل التدريب القائم على المكافأة وحده والتصريف الذاتي.