في الآونة الأخيرة، تجذب نماذج اللغات الضخمة (LLMs) أنظار المطورين بقدرتها على تحويل الأوامر اللغوية إلى أكواد برمجية قابل للتنفيذ. أدوات مثل GitHub Copilot وCursor وReplit تعتمد بشكل متزايد على هذه التكنولوجيا، مما يُسهّل على المطورين تسريع عملية كتابة الشيفرات.

ومع ذلك، تبقى هناك حاجة ماسة لتطوير طرق موثوقة لتقييم الشيفرات التي تنتجها هذه النماذج. في هذه الدراسة المبتكرة، تم اختبار تطبيق لجنة من نماذج الذكاء الاصطناعي (LLM jury) لتقديم مراجعات دقيقة للأكواد البرمجية. حيث تم Benchmarking لعدد 15 نموذجاً مفتوح المصدر على 82 مهمة تحويل نصوص MySQL إلى SQL باستخدام بروتوكول يعتمد على التنفيذ، مما أتاح فهم البيانات الابتدائية والنماذج الأكثر كفاءة.

تمت دراسة ستة من أفضل النماذج لبناء لجان موحدة تتكون من أحجام تتراوح من 1 إلى 6 أعضاء، حيث تتلقى هذه اللجان الطلبات والمخطط وSQL المرشحة، ولا تقبل الشيفرة إلا إذا أكد كل عضو صحتها. هذه القاعدة تتناسب مع أنظمة الأمان التي تتطلب عدم وجود أخطاء في القبول.

أظهرت النتائج أن القضاة من النماذج الفردية يمكن أن يكونوا غير متساوين، بينما يمكن أن تسهم اللجان الصغيرة المتوافقة من النماذج القوية في تقليل الأخطاء مع الاستمرار في قبول العديد من الطلبات الجيدة. ومن الواضح أن التركيب الدقيق للجنة له تأثير كبير.

ما رأيكم في استخدام لجان الذكاء الاصطناعي لتقييم البرمجيات؟ هل تعتقدون أنه يمكن أن يُحدث ثورة في هذا المجال؟ شاركونا آرائكم في التعليقات.