تعتبر طرق تقدير عدم اليقين (Uncertainty Quantification - UQ) أحد الأدوات الرئيسية المستخدمة في كشف الهلوسة في نماذج اللغات الضخمة (Large Language Models - LLMs)، خاصةً في البيئات التي تفتقر إلى دليل حقيقي خلال وقت الاستدلال. وقد قدمت الأبحاث السابقة اقتراحًا بدمج إشارات UQ عبر تجمعات مدروسة، ولكن الدراسات التجريبية حول متانة هذه التجمعات كانت محدودة.

تتناول دراسة جديدة إطار عمل يستخدم التجمعات المدربة إشرافيًا، حيث يتم تدريب نموذج تصنيفي باستخدام مخرجات متعددة تتعلق بطرق UQ على مجموعة بيانات صغيرة ومتخصصة تحتوي على ردود مصنفة من نماذج اللغات الضخمة. يتم تطبيق هذا النموذج بعد ذلك لتصنيف الهلوسة خارج مجموعة البيانات، دون استخدام أدوات أو مستندات مرجعية.

وقامت الدراسة، التي شملت أربعة نماذج للغات الضخمة وتسع مجموعات بيانات وثلاثة أنظمة توليد (استعلامات قصيرة، توليد نصوص طويلة، وتوليد الأكواد)، بتقديم تحليل منهجي للمتانة عبر ثلاث محاور: كفاءة العينة، انتقال مجموعة البيانات داخل المجال، والاعتماد على نظام التوليد. وقد أظهرت النتائج أن التجمعات المدربة إشرافيًا تفوقت على أفضل مُقياس فردي في 30 من 32 سيناريو، مع تحقيق المكاسب من استخدام 100 حالة مصنفة فقط. بالإضافة إلى ذلك، احتفظت التجمعات بمعظم ميزتها في حالات انتقال المعرفة تحت تغيير التوزيع، حيث تفوقت على أفضل مقياس غير متجمع في 23 من 28 سيناريو لانتقال المعرفة.

وفي ختام الدراسة، لوحظ أن التجمعات المعتمدة على العينات من نوع الصندوق الأسود كانت فعّالة تقريبًا مثل التجمعات الكاملة، بينما قدمت التجمعات ذات الجيل الفردي فوائد محدودة فقط.