في عالم يتزايد فيه الاعتماد على أنظمة التعلم الآلي مثل OpenScholar وPaperQA2 لقراءة الأدبيات العلمية وتقديم إجابات موثوقة، يكشف بحث حديث في arXiv عن عيوب خطيرة في موثوقية هذه الإحالات. يقييم الباحثون كيفية تأكد أنظمة الذكاء الاصطناعي من إحالاتها، مما يكشف عن أن هناك تفاوتًا كبيرًا في معدلات الإحالات غير المدعومة التي تتراوح من 3% إلى 18%، اعتمادًا على دقة المراجعين.

رغم أن المراجعين متفقون على الإحالات المدعومة، إلا أنهم يختلفون حول تلك التي يجب أن يتم الإبلاغ عنها، مما يتسبب في عدم موثوقية العلامات الفردية. ولطالما كانت مقارنة المقالات العلمية غير صالحة دون وجود جهة مراجعة موثوقة وبروتوكول محدد.

لذا، تم تقديم بروتوكول تقييم مبتكر يركز على موثوقية المراجعين ويقيس إعادة النسبة، مع ضمانات موثوقة ضد التقييمات البشرية. يتضمن البروتوكول إحدى أدواته القابلة للتبديل بناءً على التكلفة، ويضيف طبقة حماية لتحديد الحدود الخاصة بالإحالات غير المدعومة.

تم اختبار النظام المبتكر عبر أربعة نماذج كبيرة على مؤشرات عامة مثل SciFact، QASA، وPubMedQA، مما يضمن موثوقية النتائج. يُعتبر هذا البحث خطوة هامة نحو تعزيز النزاهة العلمية في عصر الذكاء الاصطناعي.