تواجه النماذج اللغوية الضخمة (Large Language Models) تحديات كبيرة نتيجة اعتمادها على بيانات تدريب مشتقة من البشر، مما يحد من قدرتها على إصدار أحكام صحيحة بصورة قاطعة. ومع ذلك، يقدم بحث جديد إطارًا مبتكرًا يتجاوز هذه القيود.

يركز هذا الإطار على قدرة نماذج الذكاء الاصطناعي (AI) على توليد والتحقق من معارف جديدة بشكل ذاتي، عبر تفاعل مباشر مع بيئاتها. تكمن الفكرة الرئيسية في أسلوب تعليمي غير محدد، يعتمد على جوائز رقمية، مثل مساحة الأقراص المضافة أو عدد المتابعين، كأدوات لتوجيه التعلم دون الحاجة لمقاييس بشرية.

تقوم وكلاء الذكاء الاصطناعي (AI agents) بتوليد استراتيجيات جديدة وكتابة أكواد قابلة للتنفيذ لزيادة هذه المعايير، حيث تشكل النتائج الناجحة قاعدة لإعادة تدريبها المستمر وتعميم المعرفة. للتغلب على مشاكل مثل انهيار النموذج واعتبارات البداية الدافئة، يشدد هذا الإطار على أهمية التحقق التجريبي تفاديًا للتشابه النصي، ويدعم تحسين الأداء باستخدام تقنيات مثل GRPO.

تعتمد بنية النظام على وكلاء خلية لتنفيذ تحليلات بيئية، توليد استراتيجيات، وتوليد الأكواد، مما يسمح بتجارب قابلة للتوسع.

هذه الدراسة تمهد الطريق نحو أنظمة ذكاء اصطناعي تسعى للتطور الذاتي، مما يعزز آفاق الوصول إلى ذكاء عام مستقل بعيدًا عن القيود البشرية.