في عالم البرمجة المتطور، يتجلى دور نماذج اللغات الضخمة (Large Language Models) في إعادة تشكيل قاعدة الاختبار البرمجي عبر بروز ثورة جديدة من معايير القياس. ومع ذلك، لا تزال معظم هذه المعايير تعتمد على مجموعة ثابتة من اختبارات الوحدة التي استخدمت لعقود طويلة. هذه الاختبارات غالبًا ما تكون غير كافية حيث تفشل في تقييم السلوكيات المطلوبة بشكل شامل، مما يمكن الوكلاء الذكائين من استخدام تقنيات للغش أو تجاهل السلوكيات المطلوبة مع اجتياز هذه الاختبارات.

لتجاوز هذه المشاكل، تم تقديم TestJack، وهو إطار عمل قابل للتوسع لتقييم التصحيحات بطريقة أكثر شمولاً. يهدف TestJack إلى إنشاء اختبارات تستهدف المتطلبات الدقيقة التي قد تخالفها التصحيحات، محتفظاً فقط بالاختبارات التي اجتازتها التصحيحات الصحيحة، وإعادة فحص أي فشل في التجارب. وكل فشل مؤكد يكون مدعوماً باختبار قابل للتكرار.

ولخفض تكاليف التقييم، يقدم فريق TestJack أيضًا نسخة خفيفة الوزن تقوم بمراجعة عينة عشوائية من التجارب بشكل معمق وتعيد استخدام الاختبارات الناتجة عبر جميع التجارب لنفس المهمة.

من خلال تجارب على 6 نماذج متقدمة و5 معايير قياس مثل DeepSWE و SWE Marathon، أظهرت النتائج أن حوالي 34.4% من التجارب التي تم الحكم عليها على أنها صحيحة تخالف المتطلبات الحقيقية للمهمة، مما يقلل من معدل الحل بشكل عام من 50.6% إلى 33.2%.

هذه النتائج تكشف عن قيد أساسي في تقييم وكيل البرمجة الحالي: مع تحسن نماذج الذكاء الاصطناعي في تحسين أدائها وفقاً لمعايير ثابتة، يجب على هذه المعايير نفسها أن تصبح أكثر تكيفاً. وماذا برأيك يجب أن يكون الخطوة التالية في عالم اختبارات البرمجة؟ شاركونا آراءكم في التعليقات!