في السنوات الأخيرة، أصبحت نماذج اللغات الضخمة (Large Language Models) وكيل البرمجة أداة مهمة في مهام البرمجيات، ولكن لا تزال بعض الوكلاء، مثل Qwen3 Coder 30B، تواجه صعوبة في تفسير نية المستخدم وتنفيذ المهام المعقدة ذات الخطوات المتعددة.
تظهر هذه الفجوة بشكل خاص في الإعدادات الطويلة الأجل، حيث يتعين على الوكيل أن يتفقد النتائج السابقة، ويشخص الأخطاء، ويختار التعديل التالي للكود وفقًا لقيود التفاعل. هذا الأمر دفعنا إلى التساؤل: كيف يمكننا تحسين عملية التفكير لوكلاء البرمجة الضعفاء؟
قمنا بدراسة هذه المسألة في مشروع CodeClash، وهو معيار تنافسي يقيم ثمانية وكلاء ترميز تجاريين عبر ستة ميادين في مسابقات متعددة الجولات. ومع تصنيف Qwen3 Coder Plus في المرتبة الأخيرة بينهم، قمنا بدراسة Qwen3-Coder-30B المفتوح الوزن لمعرفة كيفية تحسينه باستخدام المعرفة المقطرة من الوكلاء الأكثر قوة.
أظهرت تحليلاتنا أن Qwen3-Coder-30B ليس مُحسناً بشكل جيد للتفاعل في أسلوب الميدان: حيث ينتج أخطاء في التركيب وبروتوكولات التفاعل بصورة متكررة، ويظهر تكيفًا استراتيجيًا ضعيفًا عبر الجولات.
للتغلب على هذه الحواجز، اقترحنا تقنية جديدة تُسمى ReAct SFT، والتي تعيد كتابة مسارات المعلم إلى سلاسل واضحة تتضمن [المراقبة][الفكر][الفعل]، بالإضافة إلى تقنية SFT المعتمدة على جودة المسارات، التي تُعيد وزن العينات لتشجيع مراجعة التعديلات بعد التنفيذ.
أثبتت نتائجنا أن ReAct SFT تُحسن بشكل ملحوظ السلوك الاستراتيجي، مما أدى إلى تفوق النموذج المُعدل على Qwen3 Coder Plus في تقييمات البطولة.
هل تعتقد أن تحسين وكيل البرمجة يمكن أن يهز ساحة المنافسة في البرمجة؟ شاركونا آراءكم في التعليقات!
تحسين أداء وكيل البرمجة Qwen3 Coder 30B: كيف يفكر مثل وكيل CodeClash؟
تسعى الأبحاث الحديثة إلى رفع كفاءة نماذج وكيل البرمجة الضعيفة، حيث يركز البحث الحالي على Qwen3 Coder 30B. بفضل أساليب جديدة، تم تحسين أداء النموذج في بيئة تنافسية معقدة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
