في عالم البرمجيات المتسارع، تعتبر دقة اختبارات البرمجيات ضرورية لضمان جودة المنتجات. يهدف اختبار الطفرات (Mutation Testing) إلى تقييم كفاية حزم الاختبار عن طريق إدخال أخطاء اصطناعية في الكود البرمجي. ومع ذلك، أدت القيود المرتبطة بالأدوات التقليدية، التي تعتمد على القواعد، إلى توليد أعداد كبيرة من الطفرات التافهة أو المكررة، مما يقلل من فاعليتها في تحديد الثغرات.
مع ظهور نماذج اللغة الضخمة (Large Language Models) مثل Gemini وGPT، بدأ العلماء في استكشاف طرق جديدة لتوليد طفرات أكثر واقعية. لكن معظم هذه النماذج لا تملك الوعي بالاختبارات الحالية، مما يدعو إلى الحاجة لتطوير آلية جديدة تعتمد على "توليد الطفرات الواعية للاختبارات". في هذه العملية، يتم تزويد النموذج بعنوان المشكلة والحل المرجعي وأساس الاختبارات في طلب واحد، مما يتيح له توليد طفرة غير تافهة تمر بنجاح عبر الاختبارات الأساسية.
في إطار هذا المشروع، تم تقييم الأداء عبر مجموعة من النماذج مثل Gemini 3.1 Pro وGPT 5.1 Codex Mini على مؤشرات الأداء HumanEval وMBPP. تم استخدام مجموعات اختبارات EvalPlus كضمان آلي للتحقق مما إذا كانت الطفرات المتبقية تمثل أخطاء حقيقية. أظهرت النتائج أن معدل الأخطاء المثبتة بلغ 87.7% لمؤشر HumanEval و79.1% لمؤشر MBPP، مما يتخطى بشكل كبير معدل الطفرات التقليدية.
تعتبر هذه النتائج نقلة نوعية في عالم اختبار البرمجيات، حيث لا يقتصر الأمر على معرفة مدى أداء الطفرات، بل يكمن الابتكار في تقليل تكلفة الحساب لكل خطأ مثبت. يفتح هذا البحث آفاقًا جديدة للبحث المستقبلي ويضع أساسًا قويًا للتطبيقات في بيئات الإنتاج.
هل تعتقد أن هذه التقنية ستحدث فارقًا في جودة البرمجيات؟ شاركونا آراءكم في التعليقات.
إحداث ثورة في اختبار البرمجيات: توليد طفرات واعية للاختبار باستخدام نماذج اللغة الضخمة!
تسعى الأبحاث الحديثة إلى تحسين اختبار البرمجيات عن طريق توليد طفرات واعية للاختبارات باستخدام نماذج اللغة الضخمة، مما يسهم في تحسين دقة اختبار البرمجيات وكفاءة اكتشاف الأخطاء. تعرفوا على تفاصيل هذا الابتكار المذهل!
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
