في عالم البرمجة، تعتبر نماذج استرجاع الكود المبنية على التضمينات (Embeddings) من العناصر الأساسية التي تعتمد عليها الوكلاء البرمجيون لتوليد الكود المُعزز. ومع ذلك، كانت هناك تساؤلات مستمرة حول مدى قدرة هذه النماذج على استرجاع الكود الصحيح بدلاً من استرجاع نسخ مشابهة لغوياً فقط.

حلت هذه الإشكالية بإطلاق معيار ExecRetrieval الجديد، الذي يقدم طريقة فعالة لقياس الفرق الوظيفي في استرجاع الكود. ينصب تركيز ExecRetrieval على إنشاء مجموعة اختبار تتضمن نسخاً مختبرة التنفيذ من كل تنفيذ نموذجي، مما يسهل اختبار قدرة استرجاع الكود على التفريق بين الكود الصحيح ونسخ الكود القريبة الخاطئة.

يتضمن ExecRetrieval 939 مهمة برمجية مع تنفيذ نموذجي مثبت وتوزيع يصل إلى أربع نسخ خاطئة تم إنشاؤها بواسطة تعديل ميكانيكي يستهدف إجراء تعديل وحيد. تم تقييم 23 نموذجاً مختلفاً من التضمينات إلى جانب استخدام تقنيات مثل BM25، مما يوفر بيئة اختبارات متكاملة.

وكشفت النتائج أن النظام الرائد عقد تحت ExecRetrieval يحقق دقة استرجاع عالية عند exec@10 = 1.00، لكن دقة استرجاع العنصر الأول exec@1 جاءت عند 0.331 فقط، مما يشير إلى أن الأخطاء تحدث في 91.5% إلى 99.4% من الحالات عبر الأنظمة الرائدة الأربعة المتاحة.

بالإضافة إلى ذلك، يمكن للباحثين الوصول إلى مجموعة كاملة من البيانات، أوراق التنفيذ، ومصفوفات التضمين من خلال رابط تم تضمينه في التقرير.

بهذا الشكل، يتسنى لنا جميعاً استكشاف العوالم الجديدة لاسترجاع الكود الفعّال، مما يُعزز من قدرة أدوات الذكاء الاصطناعي على فهم الكود وتحسين تجارب البرمجة بشكل عام.