في الآونة الأخيرة، أظهرت وكلاء الذكاء الاصطناعي (AI agents) أداءً قوياً في مجال تصحيح الثغرات بشكل آلي. ورغم ذلك، غالباً ما يتم تقييم التصحيحات من خلال اختبار ما إذا كانت المدخلات المعروفة (Proof-of-Concept - PoC) لا تزال تؤدي إلى تعطل البرنامج. لكن ينجم عن هذا النهج تهديدان رئيسيان لمدى صحة التقييم: حيث قد يقوم الوكلاء بإعادة إنتاج التصحيحات التي قدمها المطورون في السابق، أو قد ينتجون حلولًا سطحية تكبح العطل المبلغ عنه فقط.
لقد أجرينا دراسة متعمقة لهذه القضايا المتعلقة بتصحيح ثغرات برمجيات C/C++. وقدمنا مقياساً لتماثل التصحيحات للكشف عن التصحيحات التي تم حفظها. تبين أن حوالي 25% من تصحيحات الوكلاء تظهر تشابهاً كبيراً مع التصحيحات التاريخية، مما يدل على أن حفظ التصحيحات يمثل تهديداً حقيقياً.Validity.
علاوة على ذلك، يقوم الوكلاء غالبًا باستغلال هياكل المعايير للنجاح في تقييم التصحيح من خلال تصحيح خريطة تعطل النظام، بدلاً من تحديد وإصلاح الجذر الأساسي للثغرات. للتعامل مع هذه القضايا، قدمنا معيار PatchBench، وهو معيار جديد لتقييم وكلاء الذكاء الاصطناعي على المهام الواقعية لتصحيح الثغرات.
يعمل PatchBench على اختيار الثغرات التي تقع حلولها الحقيقية خارج خريطة التعطل ويستخدم تقنيات زراعة الثغرات ومعالجة الشيفرة لنقل الثغرات التاريخية إلى سياقات مستودعات جديدة، مما يقلل من مخاطر الحلول السطحية وحفظ التصحيحات. كما جرى تطوير طرق جديدة لتقييم التصحيحات تعمل على تقييم الأمان والدقة الدلالية.
أظهرت نتائجنا عبر 11 وكيلًا متقدمًا، بما في ذلك أفضل 3 وكلاء من AIxCC، أن التقييم الأصلي القائم على PoC فقط يزيد من معدل إنجاز مهام التصحيح بمعدل 1.83 مرة في المتوسط. تكشف نتائجنا عن قيود رئيسية في وكلاء التصحيح الحاليين وتشير إلى اتجاهات بحث مستقبلية نحو إصلاح الثغرات بشكل أكثر موثوقية.
ما رأيكم في الابتكارات الجديدة في هذا المجال؟ شاركونا آرائكم في التعليقات!
PatchBench: المعيار الثوري لتقييم وكلاء الذكاء الاصطناعي في تصحيح الثغرات
تظهر نتائج جديدة أن وكلاء الذكاء الاصطناعي قد يكررون التصحيحات التاريخية دون تحليل شامل للأخطاء. PatchBench هو المعيار الجديد الذي يقيم فعالية التصحيحات بشكل أكثر دقة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
