في عالم الذكاء الاصطناعي، تُعتبر القدرة على تحسين الأداء عبر الزمن واحدة من التحديات الأكثر تعقيدًا. تقترح الدراسة الجديدة أسلوبًا مبتكرًا يُعرف بـ Multi-Agent Self-Supervision (MASS)، حيث يحدث التحسين الذاتي المتكرر ((Recursive Self-Improvement، مما يمكّن النماذج من تجاوز العقبات التي تواجه تقييم المهام غير القابلة للتحقق.

تواجه النماذج في هذه الحالة عائق التقييم، حيث تكون مخرجاتها قوية لدرجة أن الخبراء البشريين يصعب عليهم تقييم دقتها بشكل موثوق. مما جعل هذه الأنظمة تتجه نحو تحقيق تقدم ذاتي.

من خلال استخدام MASS، تتداول النماذج بين تحسين سير العمل التطوري والتدريب المُشرف على المسارات الذاتية المُنتَجة، مشجعةً النموذج الأساسي على اقتراح وتنفيذ وتقييم عمليات العمل المتعددة الوكلاء بشكل دوري.

البحث الجديد يوضح أن الهيكلية متعددة الوكلاء تعزز التفكير المعقد، حيث تمكنت هذه التقنية من تحسين الأداء بمعدل يفوق 1.2-1.6 ضعفًا لكل مخرجات على أربع معايير عامة مفتوحة. كما تدل النتائج على أن التعلم المشترك للتوجيه وتنفيذ وكالة محدودة من المسارات متعددة الوكلاء يمكن أن توفر إشارة فعالة لتحسين الذات.