في عالم الذكاء الاصطناعي المتطور، تعتمد وكالات النماذج اللغوية التفاعلية على إشارات الثقة لتحديد ما إذا كان يجب الرد فورًا، أو استرجاع أدلة إضافية، أو تأجيل الإجابة. ومع ذلك، يتم تقييم مستوى الثقة عادةً بمعزل عن العواقب الناتجة عن تلك الأفعال. في هذا السياق، يأتي مفهوم "مطابقة عرض المسار" (matched trajectory replay) كطريقة مبتكرة للتحقيق في تأثير إشارات الثقة على النتائج.
قامت دراسة جديدة باقتراح بروتوكول محكم يقارن بين استرجاع المعلومات اعتمادًا على الثقة المستند إلى مخرجات النماذج مثل ميسرال (Mistral) وGPT وQwen، باستخدام مجموعات بيانات HotpotQA وMuSiQue. وقد أظهرت النتائج أن تغيير أسلوب المعايرة لتحسين الثقة يمكن أن يزيد دقة الإجابات بمعدل يصل إلى 41 نقطة مئوية. رغم ذلك، قد تؤدي هذه المعايرة إلى تقليل نطاق التغطية وزيادة الاعتماد على عمليات الاسترجاع.
على سبيل المثال، تحسنت الدقة الإجمالية بنسبة تصل إلى 15 نقطة مئوية في HotpotQA، بينما انخفضت بنسبة تصل إلى 17 نقطة مئوية في MuSiQue. وبهذا، تعكس هذه النتائج انتقال النماذج إلى مستوى تشغيل أقل خطرًا، وليس تحسينًا في الإجابات أو تصنيف الثقة.
من خلال استخدام خريطة المعايرة قبل الاسترجاع، لوحظ تحسن في الاستجابة داخل الأعماق الأولى والثانية، ولكن كانت أقل كفاءة من الثقة الخام عند العمق الثالث في جميع النماذج. بينما تساعد الأدلة الإضافية عادةً، فإن التأثير الإجمالي لا يوضح ما إذا كانت الثقة قادرة على تحديد الحلقات الفردية التي ستستفيد من مزيد من الاسترجاع.
تظهر نتائج هذه الدراسة أهمية المعايرة في جعل مخاطر الالتزام أكثر وضوحًا، لكنها لا تقدر الفوائد المتوقعة من الاسترجاع. لهذا، يلزم تقدير منفصل لقيمة المعلومات أو المردود. ويفترض أن تشمل التقييمات تقريرًا عن المعايرة المحجوزة، ومخاطر التغطية، وتكاليف الاسترجاع.
اكتشافات ثورية في تقييم استرجاع المعلومات المعتمد على الثقة: كيف تؤثر على أداء النماذج اللغوية!
تتناول هذه الدراسة كيفية تأثير إشارات الثقة على استرجاع المعلومات، وتقدم طريقة جديدة لمقارنة نتائج الاسترجاع بدقة. تشير النتائج إلى تحسن ملحوظ في دقة الإجابات، ولكن بتكلفة انخفاض التغطية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
