في عالم البرمجيات سريع التطور، تعتبر مرحلة استكشاف المستودع (Repository Exploration) أحد أهم وأغلى المراحل في سلسلة ودورات تطوير البرمجيات. حيث يجب على الوكلاء (Agents) تحديد الملفات المهمة في المستودع قبل البدء في إنشاء تصحيحات جديدة. لكن هل يمكن تفويض هذه المهمة لنماذج أقل تكلفة مع الاحتفاظ بنفس مستوى الجودة؟ هذا ما أجاب عليه بحث جديد من خلال إنشاء معيار يعرف بـ "IssueLoc-Bench".

أجرت الدراسة تقييمًا لخمس نماذج استكشاف تحت نفس واجهة التفاعل القابلة للقراءة فقط، باستخدام 499 مهمة مستمدة من SWE-bench و500 مهمة من 153 مستودعاً إضافيًا. تم قياس عدة عوامل، بما في ذلك اكتشاف المرشحين الأوائل، نسبة تغطية الملفات الثلاثة الأفضل، واستعادة مجموعة الملفات الدقيقة، بالإضافة إلى الوقت المستخدم من قبل الوكيل واستهلاك الرموز.

أظهرت النتائج أن النموذج الاستكشافي الأعلى جودة يتفوق في جميع مقاييس التوزيع، لكن البدائل الأقل تكلفة أثبتت أنها فعالة؛ حيث يمكن لهذه النماذج أن تحتفظ بما يقارب 78-94% من الأداء المرجعي عند دعم الثلاثة الأوائل و73-92% من قياس الجودة F1، بينما يقلل الوقت المستغرق بنسبة 41-88% واستهلاك الرموز بنسبة 84-95%.

يعتمد اختيار أفضل نقطة تشغيل على كيفية استهلاك النتائج في العمليات التالية: فبينما تحدد مقاييس التصنيف والتغطية النقل القابل للاسترداد، تعكس مقاييس F1 والتطابق الدقيق الأبواب المقيدة للملفات. تدعم هذه النتائج فكرة اعتبار استكشاف المستودعات مرحلة قابلة للقياس والميزانية المستقلة في تطوير الوكلاء البرمجيين، مع توجيه اختيار النموذج وفقًا لعقد النقل في المراحل اللاحقة.

إذا كنت مطور برمجيات أو مهتم بمجال الذكاء الاصطناعي، فما رأيك في هذه الابتكارات الجديدة؟ شاركنا أفكارك في التعليقات!