أعلنت مجموعة من الباحثين عن إطلاق مجموعة بيانات جديدة تحت اسم "المستودع المطوّر المنقح للبرمجيات" (CIDR)، والتي تتضمن مجموعة ضخمة من المستودعات البرمجية الحقيقية التي تم جمعها بالتعاون مع شركاء صناعيين. تتكون هذه المجموعة من 4,225 مستودعاً تغطي 75 لغة برمجة، وتصل مجموع خطوط البرمجيات الخام إلى 832 مليون سطر، مع 581 مليون سطر منطقي.

بالإضافة إلى المحتوى البرمجي، تحتوي مجموعة CIDR على بيانات وصفية منظمة لكل مستودع، بالإضافة إلى كامل تاريخ النسخة وخصائص تتعلق بممارسات الهندسة البرمجية مثل استخدام التكامل المستمر ووجود اختبارات آلية.

تم جمع وتنقية هذه المستودعات عبر أنبوب عمل متعدد المراحل تم تطويره خصيصاً لهذا الغرض. كما أجرى الباحثون دراسة استكشافية حول كيفية تحسين نموذج لغوي برمجي يتضمن 3 مليارات من المعاملات ليعمل بكفاءة مع مجموعة بيانات CIDR، حيث تم قياس التأثير على برمجيات المؤسسات المحفوظة.

تهدف CIDR إلى دعم أبحاث الذكاء البرمجي، وتحليل جودة البرمجيات، وأدوات المطورين، والمهام المتعلقة بهندسة البرمجيات. وسيتاح الوصول إلى CIDR بموجب ترخيص مقيد، حيث يمكن الاطلاع على تفاصيل الأهلية والشروط عبر الموقع الإلكتروني [https://fermatix.ai/#Contact].

ما رأيكم في هذه الخطوة الجديدة؟ هل تعتقدون أن هذه البيانات ستحدث فرقًا في أبحاث الذكاء البرمجي؟ شاركونا آراءكم!