في عالم البرمجيات، تطورت وكالات البرمجة المدعومة بنماذج اللغة الضخمة (Large Language Models) بشكل ملحوظ في الآونة الأخيرة، مما أدى إلى تحسين قدراتها في معالجة المهام المتعلقة بالمستودعات. ومع ذلك، تظل التحديات قائمة في كيفية تقييم وتحسين حوكمة البرمجيات بشكل فعّال.
تم تقديم SWE-Prometheus كمؤشر جديد يؤسس لمعيار لتقييم حوكمة البرمجيات في المستودعات. يتجاوز هذا المعيار التقييم التقليدي القائم على مشاكل محددة يتم تحديدها بواسطة إنسان، حيث يقدم معياراً يعتمد على مهام مفتوحة تتطلب من الوكالات التعرف على المخاطر، وترتيب الأولويات في التدخلات المطلوبة، والتحقق من الكفاءة للنتائج الناتجة.
يتضمن SWE-Prometheus تقييم ستة أبعاد للحوكمة، يحقق ذلك من خلال جمع الأدلة، والاختبارات البيئية النظيفة، ووجود بوابات سلوكية، بالإضافة إلى تقييمين مستقلين لكل بُعد. يتضمن المعيار 60 مستودعاً، حيث يتم اختبار عشرة نماذج على مجموعة عامة تضم 22 مستودعاً، وتظهر نتائج التحسينات. تتراوح القيم المطلوبة لتحسين الحوكمة بين 0.0568 و0.5760، في حين أن معدلات تضمين الأخطاء السلوكية تتراوح بين 0٪ و23٪.
تظهر نتائج SWE-Prometheus أيضاً أهمية قياس التحسينات التي تُحقق في حوكمة المستودعات بشكل شامل، من خلال تقديم تحليلات دقيقة حول كيفية تحسين الوثائق والبيئة القابلة للتكرار والأمان.
من خلال إطلاق معايير جديدة مثل SWE-Prometheus، يصبح بالإمكان قياس فعالية التدخلات البرمجية بشكل دقيق مما يساعد في تعزيز جودة المشروع وجهود التطوير بشكل عام.
فما رأيكم في هذا التطور الجديد في حوكمة البرمجيات؟ شاركونا أفكاركم وتعليقاتكم!
SWE-Prometheus: مع benchmark جديد لتحسين حوكمة البرمجيات في المستودعات
أطلق الباحثون معياراً جديداً يسمى SWE-Prometheus، يهدف لتحسين حوكمة البرمجيات عبر تقييم التغيرات في المستودعات البرمجية. يركز المعيار الجديد على تحديد المخاطر وترتيب الأولويات بدقة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
