في مجال تطوير البرمجيات، أصبحت نماذج اللغة الكبيرة (LLMs) أداة قيمة في العديد من المهام، بدءًا من توليد الشفرات وحتى ترجمتها. ولكن، هل تتمكن هذه النماذج من فهم المعاني والدلالات البرمجية بعمق؟
تركز دراسة حديثة على ما يُعرف بمهمة "توقع تنفيذ البرامج" (Program Executability Prediction - PrEx)، والتي تهدف إلى معرفة ما إذا كانت النماذج تستطيع تحديد ما إذا كان البرنامج صالحًا دلاليًا أو غير صالح. بمعنى آخر، نحن نتحدث عن قدرة هذه النماذج على تقييم الشفرات ومعرفة القاعدة البرمجية التي قد تنتهكها.
لإجراء التجربة، تم تجهيز مجموعة بيانات معقدة تتضمن تحويلات غير صالحة تم استخراجها من برامج صالحة. وبهذا الشكل، تم اختبار نماذج البرمجة المفتوحة المصدر في ظروف استخدامها القواعد الدلالية.
أظهرت النتائج أن معظم نماذج اللغة الكبيرة تميل إلى الاعتماد على ما تعلمته مسبقًا بدلاً من تطبيق القواعد الجديدة. وهذا يعني أن أدائها كان ضعيفًا في النماذج المعدلة ومع زيادة تعقيد البرامج.
الجدير بالذكر أن مهمة PrEx متاحة للباحثين عبر هذا الرابط: GitHub Link.
تفتح هذه الدراسة بابًا جديدًا لفهم حدود الذكاء الاصطناعي في البرمجة، وتشير إلى الحاجة إلى مزيد من التقدم لتحسين هذه التقنيات.
استكشاف حدود نماذج اللغة الكبيرة في فهم شفرات البرمجة: هل يمكنها التنبؤ بصلاحية البرامج؟
تسعى نماذج اللغة الكبيرة (LLMs) لتجاوز قيود فهم شفرات البرمجة، من خلال اختبار قدرتها على تنبؤ صلاحية البرامج. وفقًا لدراسة جديدة، تعود هذه النماذج لاعتمادها على الخبرة السابقة بدلاً من فهم القواعد البرمجية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
