في ظل التطورات السريعة التي يشهدها عالم الذكاء الاصطناعي، تبرز تقنية الجيل المعزز بالإسترجاع (RAG) كأداة فعالة في تحسين قدرات نماذج اللغات الضخمة (LLM) في اكتشاف ثغرات البرمجيات. تعتمد هذه التقنية على دمج المعرفة المسترجعة من تقارير الثغرات لتعزيز دقة التنبؤات.

ومع ذلك، تُواجه الأنظمة المعتمدة على الجيل المعزز بالإسترجاع (RAG4SVD) تحديات كبيرة تتعلق بإعادة إنتاج التجارب وفتح مصادر المعلومات. حيث غالبًا ما يتم تقييم هذه الأنظمة باستخدام نماذج احتكارية، مما يشكل عائقًا أمام الفكر العلمي المفتوح. بالإضافة إلى ذلك، تسبب اختلاف مجموعات البيانات وقواعد المعرفة والنماذج المستخدمة في صعوبة المقارنة بين الأنظمة المختلفة.

في دراستنا هذه، قمنا بتحليل ستة أنظمة مفتوحة المصدر من RAG4SVD، وركزنا على معالجة القضايا المتعلقة بإعادة الإنتاج والمقارنة عبر تنفيذ تقييم شفاف يتضمن مجموعة بيانات موحدة ومعايير محددة. كما أجرينا تحليلاً على مستوى المكونات، حيث قمنا بتفكيك الأنظمة إلى مراحلها الأساسية.

أظهرت نتائجنا أن إمكانية إعادة الإنتاج تختلف بشكل كبير بين الأنظمة. كما أن أداء RAG4SVD المنشور قد لا يكون قابلاً للتحويل تحت تقييم مبني على وزن مفتوح، مما يعني أن جودة النموذج تلعب دورًا رئيسيًا.

تجدر الإشارة أيضًا إلى أن التحليل على مستوى المكونات يظهر أن فعالية RAG4SVD تعتمد بشدة على التنسيق بين مراحل النظام المختلفة. فعلى الرغم من أن وجود معرفة ممتازة يمكن أن يرفع من فعالية الاسترجاع، إلا أن الأداء قد يبقى منخفضًا إذا لم يكن هناك توازن بين مراحل الكشف.

في النهاية، توضح هذه الدراسة أهمية تقييم RAG4SVD ليس فقط كنظام متكامل، بل على مستوى المكونات، مما يوفر أساسًا لممارسات تقييم أكثر معيارية ووعي RAG.