في عالم يعتمد على الذكاء الاصطناعي، تبرز نماذج اللغات الضخمة (Large Language Models) كأدوات فعالة لتقديم المشورة والدعم في مجالات حساسة مثل الصحة الإنجابية. ومع ذلك، فإن هذه النماذج، على الرغم من تقديمها إجابات تبدو داعمة، قد تعزز في الوقت ذاته افتراضات ضارة حول القضايا الحساسة اعتمادًا على كيفية صياغة النصوص والمحتوى.


في هذا السياق، تم تقديم تقييم التوافق السلوكي كطريقة جديدة ومبتكرة. يقوم هذا الأسلوب بتوظيف أدلة من أدوات تقييم معتمدة لاختبار العلاقات بين المخرجات. باستخدام مقياس وصمة الإجهاض على المستوى الفردي، تم تحفيز خمسة نماذج من اللغات الضخمة لإكمال استبيانات لـ 627 شخصية، وتمت مراجعة الأنماط المحددة مع خمسة خبراء في الصحة الإنجابية.


أظهرت النتائج أن النماذج سجلت درجات أقل للشخصيات المتعلقة بالحكم الذاتي، ولكنها سجلت درجات أعلى فيما يتعلق بمخاوف الحكم. وقد وجدت الدراسة أن معظم النماذج جعلت المخاوف هي البُعد الأعلى في التقييم، رغم كونها الأقل في عينة المراجع لأداة التقييم. ومن المثير للاهتمام، أن أربعة من خمسة نماذج عكست اتجاه المراجع من خلال توليد درجات أعلى بكثير لمخاوف الحكم بالنسبة للشخصيات السمراء.


كما أظهرت النماذج انحيازاً شديداً نحو السرية بعد الإجهاض، على الرغم من وجود أنماط مختلفة من الوصمة عبر الشخصيات. وقد أوضحت مراجعة الخبراء أن الإرشادات المتعلقة بالإفصاح تحتاج إلى سياق حول سلامة العلاقة والمخاطر القانونية والدعم الموثوق.


يغمرنا هذا البحث في عمق تأثير تكنولوجيا الذكاء الاصطناعي على رعاية الصحة الإنجابية، مما يسلط الضوء على الحاجة الملحة لمراقبة وتقييم كيفية استخدام هذه النماذج في قضايا حساسة للغاية. كيف يمكن أن تؤثر نتائج هذا البحث على تطوير نماذج الذكاء الاصطناعي في المستقبل؟ شاركونا آراءكم في التعليقات!