في عالم الذكاء الاصطناعي، تعد وكالات كتابة التعليمات البرمجية أداة ثمينة، لكن مدى موثوقيتها وأمانها لا زال موضوع جدل. في هذا السياق، أصدرت دراسة جديدة على موقع arXiv تسلط الضوء على أخطاء تطبيق معيار Pass@k الذي يعتمد عليه حاليًا في تقييم هذه الوكالات.

يذكر الباحثون، أنه يتم تطبيق معيار Pass@k بطريقة خاطئة، حيث يتم حساب عدد الاختبارات الوحدوية (unit tests) بدلًا من العدد الفعلي للاختبارات المستقلة. وهذا يؤدي إلى تضليل النتائج، حيث يتم الخلط بين حجم مجموعة الاختبارات واستقلالية المحاولات.

لتصحيح هذا الخطأ، اقترح الباحثون معيارًا جديدًا يُسمّى reliability@k. هذا المعيار يتم تطبيقه بشكل صحيح مع مراعاة عدد المحاولات المستقلة، ويهدف إلى تقديم تقييم أكثر دقة لوكالات الذكاء الاصطناعي عند توليد التعليمات البرمجية.

من خلال دراسة متعددة المحاولات، وجد أن المقياس الخاطئ يُضخّم الدرجات المُبلغ عنها بشكل كبير، حيث ارتفعت الفروقات ما بين 0.85 إلى 0.97. بالإضافة إلى ذلك، اقترح الباحثون أيضًا معيارًا يُسمّى security-adjusted reliability@k، الذي يأخذ بعين الاعتبار الأمن الوظيفي، ليغفل تسجيل المحاولات غير الآمنة.

في اختبار أولي على واجهة برمجة التطبيقات (API) مع ثلاثة من الوكلاء، لم يؤثر هذا التعديل على التقييمات. وبالتالي، يُعتبر هذا المعيار الجديد نافذة مكملة تحتاج إلى مزيد من الاختبارات القوية لتحليل فاعليتها. كما رصد مشروع تجريبي نسبة نجاح منخفضة في اختبارات مخفية، مما يؤكد الحاجة إلى تحسين هذه المقاييس.

هل تعتقد أن هذه المعايير الجديدة ستساهم في تحسين موثوقية وأمان وكالات الذكاء الاصطناعي؟ شاركونا بآرائكم في التعليقات!