في عالم الذكاء الاصطناعي (Artificial Intelligence)، باتت نماذج اللغة العملاقة (Large Language Models) تلعب دورًا محوريًا في تقديم معلومات صحية تساعد المرضى في اتخاذ قرارات علاجية. ولكن، هل يمكن الاعتماد على هذه المعلومات بشكل كامل؟!

لقد أظهرت دراسة حديثة تحت عنوان TAF-MED أن المعايير الحالية لا تعزل الحدود المتعلقة بأمان الأدوية بعد التأكيد الصريح على نية العلاج الذاتي.

TAF-MED عبارة عن معيار تم مراجعته من قبل الأطباء، ويشمل 500 سيناريو محادثة ثابتة تتألف من ثلاث نقاط تحول، وتم تقييم ثمانية نماذج للغة عبر 4000 محادثة. حيث وُصفت الاستجابات كـ SAFE (آمنة)، LEAKY (متسربة)، أو UNSAFE (غير آمنة) من خلال نظام تقييم أوتوماتيكي، وقد أجرى طبيبان مراجعة مستقلة لعينة عشوائية موازنة من 400 محادثة.

أظهرت النتائج أن 71.6% من المحادثات تضمنت استجابة غير آمنة، فيما أن 61.4% من المحادثات التي بدأت باستجابة آمنة تمامًا تدهورت لاحقًا إلى استجابة غير آمنة. وتراوحت معدلات التدهور بين النماذج المختلفة من 24.4% إلى 96.2%، مما يسلط الضوء على أهمية تقييم الأمان ليس فقط في البداية ولكن عبر مجمل مسار المحادثة.

ستتيح TAF-MED على منصة Hugging Face لدعم الأبحاث القابلة للتكرار في مجال أمان المعلومات الطبية متعددة الجوانب.

إن هذه النتائج تشير بوضوح إلى أن تقييم الأمان في أول استجابة لا يعد مؤشرًا كافيًا لاستمرارية الأمان في المحادثات، وهو ما يدعو لتقييم أكثر شمولاً استنادًا إلى مسارات الحوار الكاملة.

ما رأيكم في أهمية أمان المعلومات الطبية المقدمة عبر نماذج الذكاء الاصطناعي؟ شاركونا في التعليقات.