لقد أظهرت الفروقات الصغيرة في قوائم أنظمة البرمجة، مثل تلك الموجودة في قائمة SWE-bench، أنه يجب إعادة تقييم كيفية تحليل أداء هذه الأنظمة. وفقًا لدراسة جديدة صدرت عن موقع arXiv، تم فحص 254 من إسهامات SWE-bench عبر أربعة أقسام دون تشغيل النماذج.
تشير النتائج إلى أن الأقصى من الإصدارين الرائدين يمكنه حل 396 من أصل 500 حالة، بينما يشارك أفضل عشرة أنظمة 285 نجاحًا و51 فشلًا، مما يترك 164 حالة تُظهر نتائجها بشكل مختلف. تُظهر مجموعة الحلول المتطورة كما هو متوقع، أن مستوى النجاح الوسيط (median nesting) يبلغ 0.935، مقابل خط أساسي مشير إلى 0.774، مما يدل على نجاحات مشتركة قوية.
أحد الأمور المثيرة للاهتمام هو أن الدرجات تعتمد أيضًا على الزوجية المعينة للنماذج مع الهياكل (model-scaffold pairs). تتراوح الفروقات في الأطر ضمن النموذج الواحد حتى 29.8 نقطة مئوية، بينما تتوزع ما بين أفضل ثلاثين نظامًا بفارق يبلغ 8.8 نقطة.
يكشف هذا البحث عن عدم إمكانية الفصل بين 29 من الأزواج القريبة من القمة باستخدام اختبارات McNemar الدقيقة عند مستوى دلالة 0.05. كما تفصل مجموعة الاختبار الأكبر 14 من أصل 23.
استنادًا إلى هذه النتائج، فإن القواعد المستندة إلى تصنيف القادة تؤدي إلى ثلاث مستويات وصفية، أو اثنين حسب تصحيح هولم، مما يعني أن عدم الرفض لا يُثبِت التكافؤ.
المثير هنا هو أننا نُطلق هذه البيانات الجديدة وبروتوكول مراجعة يتكون من خمس خطوات، ليشمل نتائج مشتركة واختبارات اختلافات زوجية وتقدير الميزانية اللازمة لحل هذه المسائل.
إن النتائج تدعم ضرورة الاعتماد على مجموعة من المقاييس المحددة مقارنة بدلًا من تفسير الفجوات القليلة على أنها اختلافات مرتبة مُثبتة.
تغيير قواعد اللعبة: لماذا لم يعد بإمكان تصنيف أنظمة البرمجة ترتيبها في قائمة SWE-bench!
تمثل الفروقات الطفيفة في قوائم أنظمة البرمجة تحليلاً غير دقيق، حيث تشير الأبحاث الجديدة إلى ضرورة إعادة التفكير في كيفية قياس الأداء. تعكف دراسة حديثة على تحليل بيانات SWE-bench المتنوعة لتحديد فعالية الأنظمة بشكل أفضل.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
