تحظى نماذج اللغة الكبيرة (Large Language Models) باهتمام متزايد في الأوساط الأكاديمية والصناعية، ولكن هل نتعامل مع ثقتها بشكل سليم؟ هذه الدراسة الجديدة تتناول مسألة الثقة المفرطة لدى موديلات مثل Qwen3-4B، والتي تميل إلى تقديم إجابات حاسمة حتى في حال وجود دلائل تشير إلى الحاجة للتريث.

في إطار هذه الدراسة، استخدم الباحثون سيناريوهات تحكمية تتلاعب بالضرورة المنطقية والإمكانية لفهم كيفية استجابة النموذج لثلاث طرق مختلفة للتعبير عن عدم اليقين: العلامات اللفظية (verbal epistemic markers)، والامتناع، ودرجات الثقة الرقمية (numeric confidence scores). وأكدت النتائج أن Qwen3-4B يميل إلى الثقة الزائدة، وخاصة عندما يتم دفعه لإنتاج درجة ثقة رقمية.

على مستوى التفسير، اقترح الباحثون طريقة لتحديد المميزات المسؤولة عن عدم اليقين واليقين بشكل مختلف. أظهر التحليل أن آلية النموذج الافتراضية تفضل توليد اليقين من خلال مجموعة واسعة من الميزات المشتركة، بينما يتم تنفيذ عدم اليقين كاستثناء نادر يتم توسيعه بواسطة عدد محدود من الميزات المخصصة.

يعد التدخل على هذه الميزات المتعلقة بعدم اليقين دليلاً على هذا الاختلالات الداخلية المسؤول عن الثقة المفرطة، كما يمكن أن تساعد في تقليل الأخطاء الناتجة عن الثقة الزائدة. تشير نفس مجموعة الميزات إلى التعميم عبر جميع أنماط التعبير عن عدم اليقين واللغات، وحتى خلال مهمة خارج النطاق.

توضح هذه الدراسة أهمية فهم سلوكيات نماذج اللغة الكبيرة وكيف يمكن أن تؤثر الثقة المفرطة على جودة النتائج. في ضوء هذه النتائج، يتساءل الباحثون: كيف يمكن تحسين أداء النماذج لتكون أكثر دقة في التعبير عن عدم اليقين؟