في عالم البرمجة، غالبًا ما يواجه الوكلاء البرمجيون صعوبات في إكمال المهام بنجاح، حتى عند إحراز تقدم كبير. إليكم ما وجده الباحثون من خلال دراسة جديدة حول نموذج Kimi K2.7 Code، والذي يمتلك 1 تيرابايت من المعلمات (مع 32 مليار نشط)، وكيف تم تكييفه باستخدام التعلم المعزز (Reinforcement Learning) لتجاوز هذه العقبات.

خلال التجربة، تم تنفيذ التعلم المعزز على 1,700 مهمة، وحددت المعايير النجاح من خلال اختبارات سرية. وكشفت البيانات عن تحسّن ملحوظ، حيث ارتفعت معدلات النجاح عبر ستة مستويات مرجعية تقييمية، حيث شهدنا تحسنًا من 60.1% إلى 64.8% على SWE-Bench Pro، ومن 31.0% إلى 43.4% على DeepSWE.

الجوانب المثيرة في هذه الدراسة تظهر أن الفرص والإمكانيات الجديدة لنموذج Kimi تم فتحها بعدما تطور ليشمل قدرات متقدمة تتجاوز القيود التقليدية.

تظهر النتائج أيضًا أن التحسن استمر حتى عندما اختبرت النماذج في بيئات لم تتدرب عليها من قبل، مما يشير إلى قوة نقل التعلم المعزز وأهميته في تطوير حلول فعالة للمهام البرمجية المعقدة.

إذا كنت مطورًا أو باحثًا في مجال الذكاء الاصطناعي، فهناك الكثير لتتعلمه من طريقة عمل هذا النموذج وكيفية تطبيقه في مشاريعك المستقبلية. لنستعد معًا لمستقبل مشوق في عالم البرمجة المبنية على الذكاء الاصطناعي، وشاركونا آرائكم حول هذه الاختراقات.