مع تقدم قدرات التفكير لسلاسل الأفكار في نماذج اللغة الضخمة (Large Language Models)، أصبح تقييم وضبط ثقتهم في استنتاجاتهم أمراً ضرورياً لفهم وعدم اليقين في الإجابات.
تستند الطرق الحالية لتقدير ثقة هذه النماذج بشكل عام إلى احتمالات محددة لمجموعة من الرموز (Tokens) الرئيسية، لكن الآلية الكامنة وراء ذلك لا تزال غير واضحة تمامًا. وجدنا من خلال دراسة تجريبية أن استبدال احتمالات الرموز المحددة ببدائل بسيطة يسهم أيضاً في تحسين معيار الثقة، مما يدفعنا للاستكشاف المنهجي لمؤشرات فعالة لثقة النموذج.
نقدم إطار عمل Divergent Token Confidence (DTC)، الذي يقيس الثقة من خلال عد الرموز التي تتعارض فيها نماذج مختلفة بقوة أثناء عملية فك التشفير. يعتمد DTC على قياس تباين Jensen-Shannon بين توزيعات الرموز التالية التي تم تقييمها على نفس مسار التفكير.
أظهرت النتائج أن عدد هذه الرموز المتباينة يرتبط سلبًا تقريبًا بدقة الإجابات، مما يجعلها إشارة بسيطة وفعالة لقياس عدم اليقين. يدعم DTC كل من التقييم الشفاف والتقييم المعتم على نماذج مساعدة، دون الحاجة لتدريب صريح أو التأثير على عملية التوليد.
أظهرت التجارب عبر عائلات نماذج متعددة وستة معايير رياضية تحسينات ملحوظة في دقة القياس مقارنةً بالطرق التقليدية المعتمدة على الاحتمالات. تحت التقييم الشفاف، حقق مقدر العد فقط متوسط خطأ تقدير متوقع قدره 13.0%، مقارنةً بـ 32.7%-42.4% لطرق الثقة التقليدية. في البيئات المعتمدة على نموذج أسود، شهدت دقة القياس أيضًا تحسينات واضحة، حيث انخفض متوسط خطأ التقدير المتوقع من 32.1%-40.2% إلى 13.7%-16.3% على نموذج DeepSeek-V3.2.
تقدم هذه الاكتشافات رؤى جديدة لتحسين قياس عدم اليقين في نماذج اللغة الضخمة، وتبدو واعدة للمستقبل. لمزيد من المعلومات، يمكنك مراجعة الكود الخاص بالبحث المتاح على GitHub.
هل يمكن لموديلات اللغة الضخمة تحسين قدرتها على التفكير؟ اكتشاف إطار قوي لقياس عدم اليقين!
تحدثت دراسة جديدة حول أهمية تقييم ثقة موديلات اللغة الضخمة في قدرتها على التفكير. تم تقديم إطار عمل مبتكر يسمى Divergent Token Confidence (DTC) لتحسين دقة القياس والتحقق من عدم اليقين.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
