أصبح الذكاء الاصطناعي جزءًا لا يتجزأ من تطبيقات العلوم الحديثة، حيث تعتمد العديد من هذه التطبيقات على نماذج اللغة الضخمة (Large Language Models) التي تقوم بمعالجة المعرفة المنظمة. لكنها ليست خالية من العيوب، حيث يواجه الذكاء الاصطناعي تحديات كبيرة تتعلق بالدقة المنطقية.

في خطوة مهمة نحو تعزيز كفاءة هذه النماذج، تم اقتراح منهجية جديدة تهدف إلى تطوير معايير موثوقة لتقييم أداء النماذج في البيئات العلمية. تتناول هذه المنهجية الطريقة التي تعتمد بها نماذج اللغة في تحديد الإجابات الصحيحة، حيث يقابل الإخفاقات المنطقية الناتجة عنها تحدي قياس الدقة بشكل موثوق.

تعتمد الطريقة الجديدة على توليد اختبارات متعددة الخيارات (MCQs) مستندة إلى تركيبيات معرفة مسبقًا ضمن أنظمة هيكلية مصنفة باستخدام OWL 2، مما يضمن أن الإجابات الصحيحة تأتي من إطار المعرفة المتاح. يتم إنشاء الخيارات الخاطئة من خلال تعديل تعبيرات تعريف الفئات، ويتم التحقق من عدم دقتها من خلال آلية تحقق.

تم تطبيق هذه المنهجية على ثلاثة أنظمة هيكلية مختلفة: نماذج Pizza، PMDco، وDOID، مما أدى إلى إنشاء أعداد كبيرة من أسئلة الاختيار من متعدد، بجودة عالية وأداء مذهل.

المعايير الجديدة تمنح تقييمات دقيقة، حيث أظهرت نماذج اللغة تنوعًا في الأداء عبر تحديد مستوى دقة يتراوح بين 41.1% و76.8%، وهو ما يتجاوز الحد الأدنى العشوائي.

ما يميز هذه المعايير هو إمكانية استخدامها لتشخيص الفشل المنطقي، مما يوفر رؤى قيمة تتعلق بكيفية تحسين نماذج اللغة في المستقبل.