في عالم الذكاء الاصطناعي المتقدم، تعتبر وكلاء البرمجة (AI code agents) من أكثر الأدوات تشويقاً، حيث تُستخدم لحل مشاكل البرمجيات الحقيقية. ولكن، يظل أمر موثوقية هذه الوكلاء تحت تأثير تغييرات سطحية في الكود غير مفهوم تماماً. لذا، أطلقت دراسة جديدة جرس إنذار حول هذا الأمر.

تستخدم الدراسة طريقة مبتكرة لتقييم أداء وكلاء البرمجة عند تعرضهم لتحولات دلالية (semantics-preserving transformations)، مثل إعادة كتابة تدفقات التحكم (control-flow rewrites) وإدخال كود غير مستخدم (dead-code injection) وإعادة تسمية المعرفات (identifier renaming).

من خلال تطبيق عينة عشوائية من هذه التحولات، تم اختبار أداء وكيلين برمجيين (mini-SWE agent وOpenCode) باستخدام أربعة نماذج متقدمة (Claude Opus 4.5 وKimi K2.5 وMiniMax M2.5 وQwen 3.6-27B) على مجموعتي بيانات مختلفة.

أسفرت النتائج عن تدهور طفيف في معدلات الحل لمختلف الإعدادات، مع انخفاض قدره 6.7 نقطة مئوية في الإعدادات الأكثر تأثراً. ولكن الأهم أن التصنيفات الخاصة بالموثوقية تختلف حسب النموذج المستخدم، حيث وُجد أن نموذج Qwen يتسم بموثوقية أعلى في بعض الحالات، بينما ينكشف ضعفه في حالات أخرى.

تشير هذه النتائج إلى أن نماذج الذكاء الاصطناعي الحديثة ليست محصنة تمامًا ضد تغييرات بسيطة في الكود، مما يثير المخاوف بشأن موثوقية استخدامها في بيئات البرمجة المختلفة.