في عالم البرمجة المتسارع، تواجه المجتمعات التقنية تحديات جسيمة تتعلق بالتحقق من دقة طلبات السحب (Pull Requests) المرتبطة بقضايا محددة في أنظمة البرمجة. ولكن ماذا لو كان هناك حل يمكنه تحسين موثوقية هذا الجانب الحيوي؟ هنا يأتي دور PAIChecker.

تُستخدم معايير البرمجة مثل SWE-bench بشكل واسع لتقييم قدرة نماذج اللغات الضخمة (Large Language Models) على حل المشكلات. تتبع هذه المعايير عملية معينة حيث يتم ربط طلبات السحب بالقضايا المرتبطة من خلال استخراج المرجعيات من الوصف، لكن هذه الارتباطات غالبًا ما تكون غير دقيقة بسبب التعقيد الطبيعي في تطوير وصيانة المستودعات الكبيرة.

قام الباحثون بإجراء دراسة منهجية على حالات VERIFIED من SWE-bench، واكتشفوا أن 13.6% منها تظهر عدم تطابق عبر خمسة أنماط في أحد عشر سيناريو دقيق. في ضوء هذه النتائج، تم اقتراح PAIChecker، وهو نظام متعدد الوكلاء يهدف إلى التحقق من عدم تطابق طلبات السحب والقضايا. يعتمد PAIChecker على تصميم يتألف من ثلاث مراحل، تشمل تحديد الأنماط، تركيب العلامات بين الوكلاء، والتحقق على مستوى الكود، مما يسمح بالكشف الأكثر دقة وشمولاً.

عبر إجراء التجارب على SWE-Gym وSWE-bench Multilingual، أظهرت PAIChecker أداءً مذهلاً، حيث حققت دقة بلغت 92.12% و91.67% كأسس ثنائية، على التوالي. مما يؤكد إمكانية الاستفادة من هذا النظام في بناء معايير برمجية موثوقة وقابلة للتوسع.

إن PAIChecker ليس مجرد أداة للتحقق، بل يمثل خطوة كبيرة نحو تحسين جودة البرمجيات ودقة تقييم أداء نماذج الذكاء الاصطناعي. كيف تتصورون تأثير هذه الأداة على عمليات التطوير في المستقبل؟ شاركونا آرائكم في التعليقات!