في عصر الذكاء الاصطناعي، يتزايد الاعتماد على نماذج اللغة الكبيرة (LLMs) في مهام تطوير البرمجيات، والتي تشمل فهم الشيفرة الحالية، التنبؤ بالسلوك، شرح الوظائف، وتصحيح الأخطاء. ومع ذلك، قد تخفي دقة التقييم الشاملة تغييرات موثوقية النموذج في ظل تعقيد هيكل الشيفرة.
تقدم ورقة بحثية جديدة إطارًا تقييمياً يأخذ في الاعتبار التعقيد عند تحليل مدى فهم نماذج مثل DeepSeek-Coder-V2 وLlama للشيفرة. يستند هذا الإطار إلى مقاييس مختلفة مثل التعقيد السيكلوماتيكي (cyclomatic complexity)، عمق التعشيش (nesting depth)، عامل التفرع (branching factor)، وحجم هالستيد (Halstead volume).
أجريت الدراسة من خلال مهام تكاملية تتضمن التنبؤ المدخلات-المخرجات تلقائياً لأكثر من 300 دالة بايثون، وتقييم فهم المعنى بشكل يدوي لمجموعة متوازنة من 60 دالة. تم تقسيم الدوال إلى ثلاث فئات تعقيد: منخفض، متوسط، وعالي.
أظهرت النتائج أن DeepSeek-Coder-V2 حققت دقة تلقائية إجمالية بلغت 78.33%، مقارنة بـ 70.33% لـ Llama. ومع ذلك، كانت الدقة تتراجع بشكل ملحوظ عند الانتقال من التعقيد المنخفض إلى العالي، حيث انخفضت دقة DeepSeek-Coder-V2 من 93.52% إلى 52.78%، بينما انخفضت دقة Llama من 87.04% إلى 47.22%. أما فيما يتعلق بالفهم الدلالي، فقد انخفضت الدقة من 100% إلى 75% لـ DeepSeek-Coder-V2 ومن 90% إلى 60% لـ Llama.
توفر إبداعات البحث الجديدة في مجال تقييم النماذج فهمًا أعمق لموثوقية الفهم البرمجي لـ LLMs مقارنةً بالاعتماد فقط على الدقة العامة. هل أصبح التعقيد الهيكلي هو العامل الحاسم في دقة نماذج الذكاء الاصطناعي؟ دعونا نتناقش في التعليقات حول النتائج المثيرة لهذه الدراسة.
تقييم الذكاء الاصطناعي لفهم الشيفرة: كيف يؤثر التعقيد على الدقة؟
تقدم دراسة جديدة إطارًا لتقييم نماذج اللغة الكبيرة (LLMs) بناءً على التعقيد الهيكلي للشيفرة. النتائج تظهر كيف يؤثر هذا التعقيد على دقة نماذج مثل DeepSeek-Coder-V2 وLlama.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
