يمر عالم البرمجة بتطورات تكنولوجية مثيرة، حيث بدأت الوكلاء البرمجيون المدعومون بنماذج اللغة الكبيرة (LLMs) في الانتقال من إجراء تغييرات محددة إلى تطوير مستودعات برمجية متكاملة. لكن تقييم قدرة هذه النماذج على توليد الشفرات البرمجية على مستوى المشروع يعتبر مهمة معقدة. هنا يأتي دور معيار E2E-SWE الذي أعلن عنه مؤخرًا.

هذا المعيار مصمم لتقييم ما إذا كانت الوكلاء البرمجيون يمكنهم بناء مستودعات برمجية كاملة من البداية إلى النهاية. يتضمن معيار E2E-SWE 186 مهمة لتوليد مستودعات كاملة تغطي 11 لغة برمجة مختلفة. يتطلب من الوكيل أن يقوم بتطوير مشروع متكامل يمكن تثبيته، اعتمادًا فقط على مواصفات تم تقديمها بلغة طبيعية وبيئة عمل فارغة.

كل مهمة يتم تطويرها بالتعاون مع مهندس برمجيات ونموذج لغة كبير، حيث يعملان معًا على تطوير مجموعة من الاختبارات ومواصفة مستقلة عن التنفيذ. لضمان أن تكون المهام محددة بشكل جيد وقابلة للحل عمليًا، يتم إخضاعها لعملية تحقق تكرارية حيث تقوم الوكلاء المستقلة بمراجعة وإصلاح أي عيوب في المهام باستخدام الفحص الثابت والفشل الملحوظ من عمليات طرح النماذج الحالية.

عند تقييم 13 نموذج متطور، وجد الباحثون تفاوتًا كبيرًا في قدرة توليد المستودعات بشكل كامل، حيث تراوحت نسبة النجاح (pass@1) من 11.7% إلى 67.7%. هذه النتائج تقدم تفريقًا قويًا بين النماذج وتترك مجالًا واسعًا للتقدم في المستقبل. كما تكشف تحليل مسارات الوكلاء عن أنماط تفكير طويلة تحتاج إلى تخطيط واستدلال على مستوى النظام، والذي يعد أمرًا محوريًا لبناء قواعد الشفرة المتكاملة من الصفر.

مع المقبلات المثيرة من معيار E2E-SWE، نتطلع إلى استكشاف كيف ستستمر أبحاث الذكاء الاصطناعي في تحسين مستوى تطوير البرمجيات. ما رأيكم في هذا التطور؟ شاركونا في التعليقات.