في عالم الذكاء الاصطناعي، يبدو من المغري أن نعتقد أن تحسين نماذج الذكاء الاصطناعي بناءً على مجموعة محدودة من معايير الأداء البرمجي مثل SWE-bench وLiveCodeBench يمكن أن يكون دليلًا على القدرات العامة لهذه النماذج. لكن دراسة جديدة تكشف عن وجود فجوة كبيرة بين النتائج المحققة في هذه المعايير وبين الادعاءات بشأن الكفاءة العامة في الترميز.

تسلط الدراسة الضوء على أهمية استخدام مجموعة متنوعة من طرق التقييم لتجنب الاعتماد الزائد على معايير الأداء التقليدية. من خلال تحليل شامل لمجموعة اختبارات مستندة إلى Django، عثرت الدراسة على أن التصنيفات المستندة إلى المعايير غالباً ما تكون غير دقيقة وغير قابلة للتعميم على مهام أخرى. هذا الكشف يدعونا إلى إعادة التفكير في كيفية تقييم النماذج بعد التدريب.

تشير النتائج إلى أن التحسين وفقًا لمعايير معينة لا يؤدي إلى تحسين الأداء عبر مهام متنوعة، وأن النماذج المدربة قد تظهر ضعف القدرة على النقل بين المهام المختلفة. لذلك، يُوصى بتبني نظام تقييم شامل يعتمد على تقييمات متعددة المهام وتقييمات أشمل تلبي احتياجات التطبيقات المتنوعة.

في الختام، تشدد الدراسة على أهمية وضع معايير تقييم موثوقة ومستمرة تختلف عن الإصدارات الفردية، حيث أن غياب هذه المعايير يجعل المهندسين والباحثين يعتمدون على أدلة غير كافية في اتخاذ القرارات الهامة المتعلقة بالبحث والتطوير.