في عصر الذكاء الاصطناعي المتقدم، تواصل نماذج اللغات الضخمة (Large Language Models) إثارة التساؤلات حول كفاءتها في تنفيذ المهام المختلفة. من بين هذه المهام، تأخذ مراجعات الأنظمة البرمجية (Systematic Reviews) النصيب الأكبر من الجهد اليدوي، حيث يستغرق البحث عن المعلومات وتحليلها وقتًا طويلاً. لكن، مع التقدم السريع في تطوير نماذج اللغات، تتساءل بعض الأبحاث عما إذا كانت هذه النماذج لا تزال تقدم أداءً موثوقًا.

في دراسة جديدة، تم استخدام Benchmark لمراجعات البرمجيات (SESR-Eval) كبيانات لإجراء تقييم أداء نماذج اللغات الضخمة. تضمنت هذه الاختبارات ثمانية نماذج جديدة، وتمت مقارنة نتائجها مع سبعة نماذج سابقة. نتج عن هذا التحليل تحسن طفيف في متوسط مؤشرات المصداقية من 0.347 إلى 0.365، مما يبرز أن النماذج الأحدث تُظهر تطورًا ما، ولكن ليس بشكل كبير بما يكفي لضمان استبدال الإنسان في عملية الفحص.

أشارت النتائج أيضًا إلى أن هناك اتفاقًا عامًا بين النماذج في قرارات الفحص، إلا أن بعض معايير الشمول والاستبعاد كانت أكثر جدلًا من غيرها. وعلى الرغم من التحسينات الطفيفة التي تم تحقيقها، لا تزال النماذج بحاجة إلى تحسينات مستمرة.

لعل تطوير الأساليب المعتمدة على الوكلاء (Agent-based Approaches) والهندسة التحفيزية (Prompt Engineering) وتنقيح المعايير هي مجالات بحثية محتملة للمستقبل لتحسين أداء نماذج اللغات الضخمة في سياقات الفحص.