في عالم الذكاء الاصطناعي، أثرت نماذج اللغة الضخمة (Large Language Models) بشكل كبير على العديد من المجالات. لكن، لا تزال ظاهرة الهلاوس، والتي تعني خروج نماذج اللغة بمعلومات خاطئة على نحو واثق، تشكل تحدياً رئيسياً. يتطلب الأمر فهماً عميقاً لطريقة تقييم وقياس عدم اليقين لهذه النماذج.

تتناول الأدبيات الواسعة حول النماذج التقليدية موضوع قياس عدم اليقين (Uncertainty Quantification) وطرق المعايرة، حيث تم تصميم هذه الأساليب لتقليل الفجوة بين عدم اليقين والدقة. ومع أن بعض هذه الأساليب قد تم تعديلها لتناسب نماذج اللغة الضخمة، إلا أن الأدبيات حتى الآن تفتقر إلى تحليل معمق لفعاليتها، بالإضافة إلى عدم وجود معيار شامل للمقارنة بين الحلول القائمة.

في هذا العمل، نقوم بسد هذه الفجوة من خلال مراجعة منهجية للأبحاث السابقة المتعلقة بقياس عدم اليقين وطرق المعايرة. كما نقدم معيارًا متينًا يستند إلى بيانات موثوقة ومعروفة، حيث نقيم Empirically سبعة أساليب ذات صلة، مما يبرر الاكتشافات المهمة في مراجعتنا.

أخيراً، نوفر منظوراً للمستقبل ونبرز التحديات المفتوحة التي تواجه هذا المجال. تُعتبر هذه المراجعة من بين الدراسات الأولى المتخصصة في استعراض طرق المعايرة والمقاييس المرتبطة بنماذج اللغة الضخمة، مما يمهد الطريق لأبحاث مقبلة.