تظهر نماذج اللغة الكبيرة (Large Language Models) قدرات استثنائية في المهام التوليدية، لكن هذه القدرات تأتي مع مخاطر هامة تتعلق بإنتاج ردود غير صحيحة أو "هلوسة". لذا، فإن تقدير عدم اليقين (Uncertainty Quantification) يصبح أمراً حيوياً لضمان سلامة وموثوقية أنظمة الذكاء الاصطناعي.

حتى الآن، كانت معظم الطرق المتبعة تعتمد على قياس الانتروبيا من عينات عشوائية متعددة لتمثيل عدم اليقين، ولكن هذا غالباً ما يغفل عن المعلومات الخاصة بعدم اليقين المرتبطة بالإجابة المرشحة قيد التقييم. يؤدي هذا الإغفال إلى نتائج تصنيف غير دقيقة.

في هذه الورقة البحثية، نحلل الفجوة بين الانتروبيا العالمية الناتجة عن عينات متعددة ومستوى الثقة المحلي للإجابة المرشحة، ونقترح طريقة جديدة لتقدير عدم اليقين تُعرف باسم تقدير عدم اليقين القائم على الثقة في التسميات (Label-Confidence-Aware Uncertainty Quantification - LCA-UQ)، والتي تعتمد على تباين كولباك-لايبلر (Pointwise Kullback-Leibler - PKL).

تعمل طريقتنا على سد الفجوة بين اتساق المخرجات المُعينة واستقرار الإجابة المرشحة، مما يعزز موثوقية وثراء تقييمات عدم اليقين.

تضمنت التقييمات التجريبية عبر مجموعة من نماذج اللغة الكبيرة الشائعة ومجموعات بيانات معالجة اللغة الطبيعية (NLP) تشهد على تأثير المصادر التسمية بشكل كبير على التصنيف. بالإضافة إلى ذلك، تأكدت فعاليتها في التقاط الفروق الدقيقة بين نتائج العينات والمصادر التسمية، مما أظهر أداءً متفوقاً في تقدير عدم اليقين.

فهل أنت مستعد لاستكشاف كيف يمكن لهذه الطريقة تحسين أنظمة الذكاء الاصطناعي؟ شاركنا رأيك في التعليقات!