في عالم البرمجة المتطور، تبرز أهمية النماذج اللغوية الكبيرة (Large Language Models) كحلفاء محتملين للبرمجة الآلية. وقد أجرت دراسة حديثة تقييمًا عمليًا لمدى كفاءة هذه النماذج في توليد الشيفرة البرمجية التجارية وفقًا لمواصفات معينة.
الدراسة تناولت ثلاثة نماذج رئيسية هي Gemini Flash 3 وGPT-5.4 mini وClaude Haiku 4.5، حيث تم طلبها لحل 992 مشكلة خوارزمية كخدمات تعمل على إطار Java Spring Boot. تم استخدام أربعة مجموعات من النماذج وأدوات برمجية مختلفة مع نوعين مختلفين من التعليمات لإنتاج ثماني تكوينات مختلفة، مع منع التكرار ومنع الإجابات المُعطاة مسبقًا.
تم تصنيف الـ 7,593 طريقة برمجية المنتجة ضمن تصنيف مكون من ثمانية فئات لوصف النتائج. ومع أن conformances الهيكلية اقتربت من الأداء المثالي، إلا أن الدراسة أظهرت أن 38.4% من الطرق لم تُرجع القيمة الصحيحة، و12.9% فقط من الإجابات كانت صحيحة.
تظهر النتائج أيضاً علاقة عكسية بين موثوقية الردود وصحتها، حيث كانت الطرق التي تحسب فعليًا أقل تكرارًا وثبتت صحتها بنسبة 19.3%. من جهتها، تضمنت القيود في هذه الدراسة تركيزًا على تنفيذ مستقل لمرة واحدة لكل تكوين، وتوقيت أحادي الممر، وتصنيف بناءً على نحو التعبير، مما قد يؤثر على دقة النتائج.
تقدم هذه الدراسة رؤى مهمة حول التحديات التي تواجه استخدام النماذج اللغوية في كتابة الشيفرات البرمجية وتعزز النقاش حول إمكانيات وقيود الذكاء الاصطناعي في المجال البرمجي.
ما هي آراؤكم حول قدرة النماذج اللغوية الكبيرة على توليد شيفرات برمجية موثوقة؟ شاركونا في التعليقات.
تقييم عملي لنماذج لغوية فعالة من حيث التكلفة: هل يمكن الوثوق بها في كتابة الشيفرة البرمجية؟
تقدم هذه الدراسة تقييمًا عمليًا لقدرة النماذج اللغوية الكبيرة الفعالة من حيث التكلفة على إنتاج شيفرة برمجية توافق مواصفات محددة. النتائج تكشف عن تحديات وقيود فيما يتعلق بدقة الإجابات وموثوقيتها.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
