في عالم الذكاء الاصطناعي الحديث، يعتمد الوكلاء الذكيون على بنى معقدة، مثل Claude Code وCodex وOpenClaw، لتحقيق القدرة على التفكير المتعدد الاستخدامات والتفاعل مع الأدوات والأنظمة الخارجية. ومع ذلك، فإن هذه الهياكل المعقدة تجعل من الصعب تدريب الوكلاء بطريقة شاملة باستخدام بنى تحتية مفتوحة، حيث إن أنظمة SFT/RL الخاصة بهم لا تعبر بطبيعتها عن الاستدلال المتعدد العمليات.

للتغلب على هذه المشكلة، تم تقديم OpenForgeRL، وهو إطار عمل مفتوح المصدر يهدف إلى تدريب الوكلاء المعتمدين على الهياكل بشكل شامل في بيئات متنوعة. يتميز OpenForgeRL باستخدام بروكسي خفيف الوزن يقوم بتقديم استدعاءات النماذج الخاصة بالهياكل، بينما يسجلها كبيانات تدريب للرموز القياسية في التعلم التعزيزي (Reinforcement Learning)، مثل veRL. كما يتضمن أيضًا منظمًا يعتمد على Kubernetes يقوم بتشغيل كل عملية في حاويتها الخاصة، مما يمكّن من التدريب على أي هيكل في أي بيئة على نطاق واسع.

من خلال فصل عملية التدريب عن الاستدلال، يُمكن OpenForgeRL الباحثين من تدريب ودراسة وتحسين الوكلاء مباشرة في الهياكل الحقيقية والبيئات التي يتم نشرهم فيها. تم التحقق من فعالية إطار العمل عبر هياكل وبيئات معقدة ومتنوعة، تشمل وكلاء يعتمدون على الأدوات والأنظمة متعددة الوسائط.

على سبيل المثال، حقق OpenForgeClaw نتائج مبهرة تجاوزت 31.7 pass^3 و55.9 pass@3 على ClawEval، و33.7 على QwenClawBench. وحقق OpenForgeGUI 37.7 على OSWorld-Verified و63.0 على Online-Mind2Web و72.3 على WebVoyager. كما تفوقت كلاهما على القواعد المفتوحة للأبعاد المحددة في مختلف المعايير، وفي إعدادات GUI، تطابق أو تتجاوز النماذج الأكثر حجمًا بعدة مرات.

علاوة على ذلك، نقوم بتحليل كيفية تأثير اختيار الهيكل (مثل ZeroClaw وOpenClaw وCodex) وتعزيز التعلم التعزيزي على سلوك الوكلاء. وقد وجدنا أن بعض الهياكل أصعب بكثير في التعلم مقارنة بأخرى، وأن التعلم التعزيزي يُحسن موثوقية الوكلاء، مثل التحقق الذاتي وتغطية الأدوات وإكمال الخطط متعددة الخطوات.