تزامناً مع التطورات المستمرة في مجالات الذكاء الاصطناعي، أصبحت نماذج اللغات الكبيرة (Large Language Models) لاعباً رئيسياً في مساعدات البرمجة. ولكن تكمن التحديات الكبرى في جودة المتطلبات المدخلة، التي غالباً ما تكون غير واضحة أو غير مكتملة. قد يُظهر بحث جديد كيف يمكن تحسين تلك العمليات عبر معيار مبتكر يُعرف باسم ClarifyCodeBench.

تم تصميم معيار ClarifyCodeBench لتقييم قدرة نماذج اللغات الكبيرة في التعامل مع الغموض في المتطلبات. يسلط الضوء على الفجوة الواضحة الموجودة في التقييمات الحالية، حيث تفترض معظم المعايير وجود مدخلات مثالية ولا تعكس التفاعل الديناميكي في فكرة تطوير المتطلبات.

هذا المعيار يتكون من مهام برمجة حقيقية مع تعليقات يدوية عالية الجودة، ويشمل أنواع مختلفة من الغموض، وأسئلة توضيحية مرتبطة، وأجوبة صحيحة لها. إضافةً إلى ذلك، تم وضع مقاييس صارمة لتقييم جودة التفاعل، بما في ذلك معدل السؤال الرئيسي الذي يأخذ في الحسبان كفاءة الأسئلة، وقياس مراعاة الجولة المثلى الذي يحدد دقة عملية استنباط المعلومات.

خلال تقييم منهجي لستة نماذج لُغة متطورة باستخدام ClarifyCodeBench، تم استخراج ثلاثة رؤى رئيسية: 1) الفصل بين القدرة: الأداء القوي في توليد الأكواد ليس بالضرورة سببه فعالية توضيح المتطلبات؛ 2) مفارقة التفكير: بينما يعزز التفكير الحسابي من دقة الأكواد، إلا أنه يحقق فوائد ضئيلة في تحديد الغموض؛ 3) سقف الغموض المتعدد: تتناقص قدرة نماذج اللغات على توضيح الغموض بشكل حاد مع زيادة الكثافة، مما يكشف عن عقبة كبيرة في التعامل مع المواصفات المعقدة.

تُظهر نتائج هذا البحث الحاجة إلى الانتقال من التوليد الثابت إلى الاستنباط التفاعلي في الأبحاث المستقبلية للذكاء الاصطناعي في هندسة البرمجيات (AI4SE).