في عالم الذكاء الاصطناعي، تلعب طرق التقييم الآلي المعتمدة على المراجع (Reference-Based Evaluation Methods) دوراً محورياً في تقييم الأنظمة المقدمة للغات الطبيعية. ومع ذلك، غالباً ما تقتصر التقييمات الحالية على قياس اتفاقية النتائج مع الأحكام البشرية أو العلامات القياسية، مما يعيق فهم السلوك الحقيقي للمقيّمين تحت ظروف مضبوطة.

في محاولة لمواجهة هذا التحدي، تم تقديم إطار عمل جديد يُعرف بالفرضيات السلوكية (Behavioral Correctness Assumptions). هذا الإطار ليس منفصلاً ولكنه يُكمل الطرق التقليدية لتقييم الأداء، من خلال تحديد نوعين من الفرضيات: الفرضيات التي تحافظ على الصحة والفرضيات التي تغيرها. ويتم تشغيل هذا الإطار من خلال تحويلات استجابة مضبوطة تُحدد السلوك المتوقع لعملية التقييم.

لقد تم تقييم مجموعة متنوعة من أدوات التقييم، بما في ذلك الأدوات المعتمدة على المفردات والمستويات الحرفية والأداء الدلالي ونماذج اللغة الضخمة (Large Language Models) وغيرها. تركز التحليلات على سلوك هذه الأدوات على مستوى الفرضيات، حيث تم رصد سلوكها واستقرارها وحساسيتها وتكرار استجابتها وتوافقها.

تظهر النتائج المستخلصة من التجارب أن هناك تباينات سلوكية ملحوظة عبر paradigms التقييم المختلفة. حيث لا يوجد مقيّم يلبي جميع الفرضيات الصحية المقترحة، والأكثر إثارة للاهتمام هو أن المقومات التي تحقق نتائج اجمالية مشابهة قد تظهر ملفات سلوكية مختلفة تماماً.

هذه النتائج تُظهر أن فرضيات السلوك الصحي تقدم معلومات تشخيصية قد تخفيها التقييمات التقليدية، مما يدعو لتفكير أعمق في كيفية تقييم الأداء الأنظمة المعتمدة على الذكاء الاصطناعي. هل تعتقدون أن هذه الفرضيات ستغير طريقة تقييم الأنظمة؟ شاركونا آراءكم في التعليقات!