في عالم يتطور بسرعة في مجالات الذكاء الاصطناعي، تبرز فكرة "التأمل الذاتي" كأحد الآليات القوية التي تعزز التعلم البشري. تمثل هذه الآلية القدرة على تحويل التغذية الراجعة الضعيفة إلى إرشادات عملية قابلة للتنفيذ. ورغم ذلك، فإن إمكاناتها في تعزيز أداء النماذج اللغوية الضخمة (Large Language Models - LLMs) لا تزال غير مستكشفة بالشكل الكافي.

هنا يأتي الابتكار الجديد المسمى "تحسين السياسة من خلال التأمل الذاتي" (Self-Reflective Policy Optimization - SRPO)، وهو إطار عمل يهدف إلى استثمار هذه القدرة الفريدة.

يتيح نموذج SRPO للنماذج اللغوية الضخمة تحليل مساراتها المكتملة، وإنتاج "رقع تأملية" مختصرة عن الأخطاء، واستخدام درجات المعلم المشروطة على تجارب الطلاب كنقاط تعلم كثيفة على مستوى الرموز. هذه العملية تعمل على تحويل الإشراف النادر إلى إشارات تعلم كثيفة دون الحاجة إلى نقاد خارجيين أو نماذج مكافآت منفصلة، مما يمثل تحولاً في كيفية تعلم النماذج اللغوية.

تظهر النتائج أن SRPO يحقق أداءً متميزًا على معايير التفكير الرياضي ووكالات المدى الطويل، مع كفاءة بيانات استثنائية. باستخدام نموذج Qwen3-8B الأساسي، حقق SRPO معدل دقة يصل إلى 73.3% في AIME'24 مع استخدام 8% فقط (0.08x) من FLOPs التعليم المطلوبة مقارنة بالتدريب التقليدي. كما شهدت معدلات النجاح تحسنًا ملحوظًا على WebShop بنسبة 64.7%، وALFWorld بنسبة 76.8%، وSWE-Bench-Lite بنسبة 31.2%.

بالإضافة إلى ذلك، تم نشر الشيفرة المصدرية الخاصة بهذا الابتكار على GitHub، مما يتيح للباحثين والمطورين استكشاف هذه التقنية المتطورة.

هل أنتم متحمسون لرؤية كيف ستغير هذه الاستراتيجية مستقبل الذكاء الاصطناعي؟ شاركونا آرائكم في التعليقات!