مع دخول نماذج اللغة الكبيرة (Large Language Models) في مجال تحسين الشيفرات البرمجية الآلية، نواجه تحدياً حقيقياً يتمثل في ظاهرة تُعرف بـ 'الهلاوس الكفاءة' (Efficiency Hallucination). هذه الظاهرة تشير إلى ميول النموذج لإجراء تعديلات على الشيفرات البرمجية المثلى رغم عدم استناد ذلك إلى أساس موثوق، مما يفضي إلى إدعاءات أداء غير دقيقة.
تندرج هذه الظاهرة تحت ما يُسمى 'فخ التقييم' (Evaluation Trap)، حيث تحفز المعايير الثنائية (binary benchmarks) النماذج لإجراء تعديلات غير ضرورية بدلاً من الامتناع عن ذلك بشكل آمن. لحل هذه المشكلة، تم وضع إطار عمل للتحقق باستخدام أساليب عقوبة التصنيف، تم تقييمه عبر 180 عملية تحسين على تسعة نماذج مثل (GPT)، (Claude)، و(Gemini) باستخدام أداة (EffiBench).
في التجارب، أظهرت النماذج معدل تعديل بنسبة 100% على الشيفرات المثلى. ولكن، باستخدام تدابير الحماية، تمت زيادة تصحيح الامتناع من 0% إلى 44.4%، مع الحفاظ على معدل تعديل 100% على الشيفرات غير المثلى دون وجود أي امتناع خاطئ. تتفاوت نتائج الضبط، حيث تقترب نموذج (GPT-5.4 Mini) من الامتناع المثالي، وتُعرف الشيفرات البسيطة بشكل موثوق أكثر من الشيفرات المعقدة.
يُقدم الإطار المطور لدينا آلية خالية من التدريب للتخفيف من ثقة نماذج الذكاء الاصطناعي المفرطة قبل نشرها في الإنتاج، مما يعد خطوة مهمة نحو تحسين موثوقية الأنظمة المعتمدة على الذكاء الاصطناعي في مجال البرمجة.
هل يمكن للذكاء الاصطناعي تحسين الشيفرات البرمجية دون ارتكاب أخطاء؟ اكتشفوا ظاهرة الهلوسة الكفاءة!
تقدم نماذج اللغة الكبيرة (LLMs) تحديات جديدة في تحسين الشيفرات البرمجية، وخصوصاً من خلال ظاهرة تُعرف بـ 'الهلاوس الكفاءة'. هذه المقالة تلقي الضوء على التأثيرات المحتملة وكيفية قياس سلوكياتها.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
