في عالم البرمجيات اليوم، يعتبر التأكد من صحة التعليمات البرمجية التي تنتجها نماذج اللغة الكبيرة (LLMs) من أكبر التحديات التي تواجه مهندسي البرمجيات. تتعمق الأبحاث الحديثة في هذا المجال، مع ظهور أداة جديدة تُدعى Benchproofer، التي تمكّن المطورين من كتابة مواصفات دقيقة للتعليمات البرمجية، مما يعزز من دقة العمليات ويقلل من الأخطاء.
تقوم Benchproofer بتحويل المهام البرمجية المعروفة إلى مهام موثوقة من خلال كتابة مواصفات جديدة تلخص الوظائف القائمة بطريقة دقيقة، وتضمن التحقق الحرفي من التعليمات البرمجية الجديدة. وبفضل هذه الأداة، يمكن تحقيق SWE-Proof، الذي يتيح التحقق الرسمي لـ 500 مشكلة حقيقية بدلاً من اختبارها فقط.
أظهرت النتائج أن التحقق الرسمي يمكنه التقاط الأخطاء التي تفوتها الاختبارات التقليدية؛ حيث تنجح 85% - 95% من الحالات عند استخدام مواصفات دقيقة، مقارنةً مع ما بين 25% إلى 50% من التصحيحات التي تمر بالاختبارات فقط.
ومع ذلك، لا تخلو الرحلة من التحديات، فتوجد حاجة ماسة لجودة عالية في كتابة المواصفات، حيث لم يتجاوز 62% فقط من المواصفات المدققة معاييرنا. من الضروري تحسين هذه المكونات لضمان نجاح أكبر في المستقبل.
SWE-Proof: كيف يمكن لنماذج اللغة حل التحديات الحقيقية باستخدام إثباتات الآلة؟
مع تزايد الاعتماد على نماذج اللغة الكبيرة (LLMs) في تطوير البرمجيات، يكشف SWE-Proof عن كيفية التحقق من صحة التعليمات البرمجية المولدة بواسطة الآلة بطريقة دقيقة. التكنولوجيا الجديدة تقدّم حلاً قوياً لتحديات التأكد من صحة البرمجيات، عبر استخدام عمليات التحقق الرسمية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
