في عصر تطور الذكاء الاصطناعي، تزداد أهمية دور المراقبة في ضمان الأداء الجيد لنماذج اللغات الضخمة (Large Language Models). تعكف العديد من المؤسسات على استخدام حلقات إشراف، حيث يقوم نموذج لغوي كبير بمراجعة مخرجات نموذج آخر بالتعاون مع آثار الإجراءات المدعى بها.

لكن، تطرح هذه العملية تساؤلات حول مدى مصداقية المشرفين على هذه النماذج. تُظهر الأبحاث، التي استخدمت نظرية كشف الإشارة، تخوفًا من أن التفاصيل الدقيقة في آثار الإجراءات قد تجعل المشرفين عرضة للغش. من خلال تحليل أكثر من 4500 حكم على 19 مهمة امتثال، تبين أن وجود أدلة غير مؤكدة لا يعيق اكتشاف الأخطاء، بل قد يؤدي إلى تحول معيار القرار نحو الرفض، مما يزيد من الإنذارات الخاطئة في المشرفين المستعدين لذلك.

ما هو أكثر من ذلك، عندما لم تتوفر تسميات الخيارات، أظهرت التشفيرات التي تحققها البشر أن حوالي 60% من الإنذارات الخاطئة تعود إلى عدم القدرة على ربط الأدلة مع الخيارات المتاحة. الأمر الذي يبرز كيف يمكن أن تؤثر التفاصيل في القرار النهائي.

بشكل عام، هذه الآثار تُعتبر كأدوات حكومية تصوغ قرارات المراقبة، مما يضعنا أمام سؤال مهم: كيف يمكن تقييم المدققين في الذكاء الاصطناعي؟ يجب اعتبار معيار القرار وسلوك الإنذارات الخاطئة بجانب الدقة كعوامل رئيسية في أي تقييم مستقبلي.