في عالم الذكاء الاصطناعي، يشكل تعزيز التعلم (Reinforcement Learning) الخيار المفضل لتدريب وكلاء البرمجة القادرين. ومع ذلك، تواجه هذه العملية تحديات تتعلق بتنوع المهام وضمان موثوقية الأدوات المستخدمة للتحقق. هنا تبرز أهمية CodeMidas، المشروع الذي يغير قواعد اللعبة في هذا السياق.

يستفيد CodeMidas من قواعد الشيفرات مفتوحة المصدر كمصدر غني للمهام، ويوفر طريقة مبتكرة لخلق بيئات من التعلم من خلال تحويل الوظائف التي تم تنفيذها في الشيفرات إلى بيئات RL قابلة للتنفيذ. ويستخدم إطار العمل هذا كود المصدر كمدخلات وحيدة، مما يتيح إعداد مهام متنوعة ومتعددة. يتم توزيع المهام على مراحل مختلفة، حيث يقوم الوكلاء باستكشاف الوظائف المنفذة لتشكيل مواصفات سلوكية، وبناء اختبارات تعتمد على تنفيذ الكود الأصلي، والتحقق من الأداء من خلال الفحوصات والتنفيذ المتكرر.

نتائج المشروع مثيرة للإعجاب! حيث تم تجميع مجموعة بيانات تتضمن 5,545 مهمة تدريب من 3,185 قاعدة شفرة مفتوحة المصدر، تغطي 23 لغة برمجة و15 مجالاً تقنياً. تظهر التحليلات أن تدريب الوكلاء على هذه المهام، باستخدام النماذج مثل MiMo-V2.5 وGRPO، يحقق تحسينات على خمسة معايير متنوعة، تشمل إصلاح المشكلات وإنشاء برامج كاملة، مما يعكس كفاءة عالية في معالجة المهام.

كما تبين أن زيادة عدد المهام التدريبية عالية الجودة تسهم بشكل كبير في تحسين الأداء. التحليلات سلوكية تظهر أيضًا أن الوكلاء المدربين يتمتعون بسلوكيات أفضل، مثل زيادة استكشاف الكود وعمليات التحقق الذاتي المتنوعة.

وبذلك، يثبت CodeMidas أن كود المصدر يمثل أساسًا قابلًا للتوسع لبناء بيئات من التعزيز التعلمي تعزز من أداء الوكلاء البرمجيين عبر مهام متعددة في البرمجة.