في عالم الذكاء الاصطناعي، يُعتبر تطبيق التعلم المعزز (Reinforcement Learning) في مجال البرمجة تحديًا معقدًا. يعتمد الكثير من الوكلاء البرمجيين على بيئات تنفيذ طويلة الأمد لإدارة تكامل الأدوات وسياقات المستودعات، ولكن تلك البيئات غالبًا ما تعاني من انقطاعات وصعوبات تؤثر سلبًا على عملية التدريب. هنا يأتي دور LEGO-RL.
LEGO-RL هو إطار جديد يمزج بين الوكالات البرمجية الأصلية وعملية تحسين سياسة التعلم بدون الحاجة إلى تعديل التدفق الداخلي للتحكم. يستند الإطار إلى ثلاثة أعمدة رئيسية:
1. **تحقيق تحسين دقيق** من خلال استخدام نماذج لغة كبيرة (Large Language Models) كواجهة لالتقاط البيانات الخام لضمان توافق على مستوى الرموز.
2. **تنفيذ موثوق** بفضل تنسيق موحد يعرف باسم sandbox orchestration الذي يضمن تخزين الصور وتوفير دفاعات متعددة المراحل.
3. **تدريب قابل للمراقبة** باستخدام مكونات إضافية تلقائية للتحقق والمراقبة، مما يوفر واجهة مستخدم مباشرة لتحليل دقيق للمسارات.
قمنا بتقييم LEGO-RL من خلال تدريب نموذج MoE النادر Qwen3.5-35B-A3B باستخدام GSPO على ثلاث استراتيجيات للوكلاء البرمجيين: OpenHands SDK، Claude Code و OpenCode. وقد أظهر LEGO-RL تحسينات ملحوظة، حيث ارتفع أداء Qwen3.5-35B-A3B بشكل كبير على مجموعة الاختبار SWE-bench Verified.
إذا كنت من المهتمين بتقنيات التعلم الآلي وتطبيقاتها العملية، فإن LEGO-RL يمثل فصلاً جديدًا في تطوير الوكلاء البرمجيين وفتح آفاق جديدة للابتكار. ما رأيكم في هذا التطور؟ شاركونا في التعليقات.
إطلاق LEGO-RL: الإطار الثوري لتعزيز تعلم البرمجة باستخدام التعلم المعزز
تم الكشف عن LEGO-RL، الإطار الجديد الذي يعزز أداء الوكلاء البرمجيين عبر التعلم المعزز بطريقة مبتكرة. يهدف هذا الإطار إلى تحسين تكامل الأدوات وتقديم ملاحظات تنفيذ موثوقة للمستخدمين.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
