تعزيز قدرات التعلم المستمر يرتبط ارتباطًا وثيقًا بكيفية تفاعل العملاء البرمجيين مع المهام المعقدة. في دراستنا، نستعرض عميلًا برمجيًا مصممًا للتعامل مع مجموعة تحديات تفكير مجردة عبر لعب ألعاب ARC-AGI-3، وهي ألعاب تفاعلية لا توفر أي إرشادات. يعمل العميل على نموذج أساسي ثابت، حيث يقوم بكتابة وتنفيذ سكربتات بلغة Python وأخرى عبر سطر الأوامر.

لتعزيز عملية التعلم، يحتفظ العميل بسجل كامل لكل فعل وملاحظة، مما يمكننا من تحليل كيفية تكوين الأفكار، تصحيح الأخطاء، أو تخليها عن بعض المفاهيم. هذا الكشف مهم، حيث يظهر أن العميل يتعلم من التجارب السابقة، موثقاً الأفكار التي يتبناها أو يتركها عبر ملفات نصية وسكربتات.

مع كل مستوى من مستويات اللعبة، يتوجب على العميل مواجهة تحديات جديدة. تتضمن استنتاجاتنا أن السكربتات المكتوبة لمهمة معينة نادراً ما تُستخدم مرة أخرى في مهام لاحقة، مما يدل على أن العميل يعتمد بشكل أكبر على إعادة صياغة معرفته بطريقة تعزز النمو. وعليه، يتخلى عن 74% من السكربتات التي أنشأها قبل الانتقال بين المهام.

علاوة على ذلك، يضيف العميل ملاحظاته دون تعديل، مما يؤدي إلى تراكم التناقضات التي يتم تسويتها من خلال السجل. يُظهر تحليلنا أن العميل يتعلم بطريقة انتقائية وليس بشكل كارثي، حيث تكون الأخطاء الأكثر كلفة تلك القيم الثابتة التي يتم نقلها إلى مهام لا تنطبق عليها بعد الآن.

إن نتائج هذه الدراسة تساعد في تقديم فهم أعمق لألية التعلم المستمرة لدى الأنظمة البرمجية وكيفية تحسينها.