في عالم البرمجيات المتطور بسرعة، يبرز دور وكالات البرمجة المدعومة بنماذج اللغات الضخمة (Large Language Models) بشكل متزايد، خصوصاً في قدرتها على إصلاح الأخطاء البرمجية ضمن قواعد بيانات ضخمة. لكن، هل من الممكن الاعتماد على تقارير الأخطاء المتاحة دائمًا لضمان الجودة؟ الأمر أصبح معقدًا في كثير من الأحيان.

لذا، نحن في حاجة إلى معايير جديدة، وهنا يأتي دور Active-SWE. هذه المعايير الجديدة تعتمد على تقييم وكالات البرمجة على قدرتها في اكتشاف وتصحيح الأخطاء بشكل استباقي، دون الحاجة إلى تقارير مسبقة، مما يفتح آفاقًا جديدة في كيفية تقييم أداء هذه الوكالات.

يغطي Active-SWE ما يصل إلى 1,663 مهمة عبر ست فئات خطأ وثماني لغات برمجة، ويشمل تغييرات جوهرية في كيفية تقييم الأداء، حيث ينتقل التركيز من تصحيح الأخطاء المُسجلة إلى اكتشاف الأخطاء المتعددة في آن واحد. وهذا يعني أن Active-SWE لا يركز فقط على إصلاح المشاكل المعروفة، بل يستهدف أيضًا اكتشاف الأخطاء المحتملة التي قد تظهر مستقبلاً.

لتطوير Active-SWE، تم وضع صياغة مهام جديدة على أساس صعوبة هذه المهام، بالتزامن مع إطار تقييم مزدوج المسارات، مما يسهل التقييم الشامل لقدرات وكالات البرمجة.

تظهر التجارب الواسعة أن معظم الوكالات المتقدمة تكافح على صعيد مهام التصحيح الاستباقي، مما يعكس أداءً محدودًا في تحديد وإصلاح الأخطاء المسجلة، والتعامل مع سيناريوهات تصحيح متعددة، واكتشاف الأخطاء المحتملة الصالحة.

في النهاية، يبدو أن مستقبل البرمجة يعتمد على الابتكارات مثل Active-SWE، والتي تدفعنا نحو استراتيجيات جديدة في إصلاح الأخطاء وفهم الأداء.

ما رأيكم في هذا التطور الثوري؟ شاركونا آراءكم في التعليقات!