في عالم البرمجة المتسارع، تلعب مراجعات الكود (code reviews) دورًا حيويًا في ضمان جودة البرمجيات. ومع توسع استخدام نماذج اللغات الضخمة (Large Language Models)، ظهر تحدٍ جديد: القدرة على تحديد صحة التعليقات الفنية التي قد تكون مقنعة ولكنها غير دقيقة.

لذا، تم تقديم معيار جديد يُعرف بـ CRJudgeBench، والذي يحتوي على 1199 ملاحظة مستخلصة من طلبات سحب حقيقية (pull requests) تم التحقق من صحتها من قبل الخبراء. هذا المعيار يتميز باستخدام مثالين: التعليقات الموثوقة وأخرى تبدو مقنعة لكنها تخفي في واقعها أخطاءً فنية.

تعمل وكالة Sentinel، التي تعتمد على CRJudgeBench، على تحسين دقة التقييم من خلال جمع الأدلة البرمجية للتحقق من صحة التعليقات قبل إصدار الحكم. تم تدريب Sentinel على مجموعة التدريب من CRJudgeBench عبر عملية تعلم مستمرة تعمل على توفير أفضل النتائج.

تظهر النتائج التي حصلت عليها Sentinel دقة تقدر بـ 76.60% في اختبار CRJudgeBench، متفوقةً على نموذج GLM-5.3 بزيادة 6.13 نقطة مئوية، وعلى النموذج الأساسي بـ 19.78 نقطة مئوية. يشير ذلك إلى أن حتى أفضل نماذج الذكاء الاصطناعي العامة تواجه صعوبات في تحديد التعليقات غير الموثوقة، مما يبرز أهمية التعلم المستمر في تعزيز دقة التقييمات.

إذا كنت مطور برمجيات، فإن هذا التطور قد يغير قواعد اللعبة في كيفية فهمنا لمراجعة الكود. ما رأيكم في هذا الابتكار؟ شاركونا في التعليقات!