في ظل الاستخدام المتزايد لنماذج اللغات الضخمة (Large Language Models - LLMs) في البحث واسترجاع المعلومات، تبرز الحاجة الملحة لتقييم موثوقيتها في مجالات حساسة مثل الرعاية الصحية. تتمتع LLMs بقدرة لافتة على الإجابة عن تساؤلات تتعلق بالأمراض والأعراض والعلاجات، ولكن في المقابل، لا يزال من غير الواضح ما إذا كانت قادرة على تقييم العلاقات السببية بدقة واستنادها إلى أدلة علمية موثقة.
تقدم الدراسة التي نحن بصددها، والتي تُعتبر دراسة أولية صغيرة النطاق، تحليلًا حول دقة LLMs في تقييم الادعاءات الطبية السببية ودعمها بأبحاث راجعة النظر. يتضمن البحث إطار عمل تقويمي للتحقق من الفرضيات السببية، مما يتيح تتبع أداء LLMs الحالية والمستقبلية بشكل منهجي.
تتطرق الدراسة إلى أداء ثماني نماذج لغوية ضخمة على 17 فرضية طبية سببية، لتقييم قدرتها على التحقق من هذه الفرضيات باستخدام الأدلة العلمية المتاحة في الأدبيات. وقد تم تصنيف الأدلة العلمية التي قدمتها هذه النماذج وفقًا لستة معايير (بإجمالي 1,067 نقطة تصنيف) وتقييمها بتسعة معايير مختلفة.
أشارت التحليلات إلى أن LLMs تظهر قوة في الاسترجاع، إلا أنها غالبًا ما تفشل في تقديم مقالات علمية صالحة وأدلة للدعم، بالإضافة إلى عدم قدرتها على رفض الفرضيات غير المدعومة. تكشف هذه النتائج عن محدودية حرجة في النماذج الحالية، حيث لا يمكن الوثوق بها بشكل كامل للتحقق من العلاقات السببية في الأدبيات الطبية.
هذه الدراسة تؤكد الحاجة إلى تقييم دقيق قبل اعتماد LLMs كمصدر موثوق للبحث والاسترجاع في مجال الرعاية الصحية. فمتى ستكون لدينا الثقة الكاملة في هذه النظم؟ هذا لا يزال سؤالاً معلقًا بحاجة إلى إجابة.
تحقيق الفرضيات الطبية باستخدام نماذج لغوية ضخمة: هل نثق بها حقاً؟
يكشف البحث عن الثغرات الكبيرة في دقة نماذج اللغات الضخمة (LLMs) في تقييم الفرضيات الطبية. يستعرض استراتيجية لتقييم موثوقية هذه النماذج في مجال الرعاية الصحية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
