تعتبر نماذج اللغة الكبيرة (LLMs) واحدة من أحدث الابتكارات في مجال الذكاء الاصطناعي، لا سيما في مجال الرعاية الصحية حيث تُستخدم للإجابة عن الأسئلة الطبية ودعم القرار السريري. ورغم الأداء القوي الذي حققته هذه النماذج، إلا أن ثقتها في ظل ظروف الغموض تبقى غير مفهومة بشكل كافٍ.
في دراسة جديدة، تم إجراء تحليل سلوكي شامل لنماذج اللغة الكبيرة بوجود غموض المعلومات السريرية. تم اقتراح إطار تقييم جديد يعتمد على مجموعة بيانات MedMCQA، حيث تم إدخال إعدادين مختلفين للغموض كالتالي:
1. إدخال إشارات غموض لغوية من خلال تعديل العبارات لجعل البيئات السريرية تبدو أكثر غموضًا.
2. إعداد إزالة الإجابة، حيث يتم استبعاد الخيار الصحيح عمدًا، مما يتطلب من النموذج التعرف على عدم كفاية المعلومات ورفض تقديم إجابة.
تظهر نتائج البحث أن النموذج رغم انخفاض دقته مع تزايد الغموض، إلا أن ثقته تظل غير متسقة مع مستويات الدقة. مما يؤدي إلى زيادة كبيرة في الأخطاء الناتجة عن الثقة غير الآمنة، مما يدل على أن ثقة النموذج تبقى غير حساسة بشكل كبير لفقدان المعلومات السريرية المهمة.
علاوة على ذلك، فقد لوحظ تباين كبير بين النماذج في قدرتها على الامتناع عن إعطاء إجابات عندما تكون الإجابة الصحيحة غير متاحة، حيث تواصل بعض النماذج إنتاج إجابات عالية الثقة ولكن غير صحيحة. توضح هذه النتائج الحدود الحرجة للموثوقية المعرفية للنماذج الحالية، وتسليط الضوء على الحاجة الماسة لأساليب تقييم واعية للغموض قبل نشرها في مجالات العمل السريري.
في عالم يتطلب دقة متناهية، هل يمكن الاعتماد على هذه التقنيات الجديدة؟ ما رأيكم في إمكانية تطوير نماذج أكثر موثوقية؟ شاركونا في التعليقات.
فشل الثقة: كيف تبرز الثقة الزائدة في نماذج اللغة الكبيرة (LLMs) وسط غموض المعلومات السريرية؟
تظهر نماذج اللغة الكبيرة (LLMs) الأداء الممتاز في معالجة الأسئلة الطبية، لكنها تواجه تحديات خطيرة في ظروف الغموض. نتائج الدراسة تسلط الضوء على وجود أخطاء قاتلة بسبب الثقة الزائدة في التنبؤات غير الدقيقة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
