شهدت الأبحاث في الذكاء الاصطناعي قفزات نوعية، وآخرها نموذج Gemma 4 31B-IT الذي تم تقييمه في سياق حاسم للغاية للسلامة، وهو امتحان الترخيص للعاملين بالمفاعلات النووية.

تتكون هذه الدراسة من تقييم شامل للنموذج الذي يحمل 31 مليار معلمة، حيث تم تطبيق معايير صارمة تقيس قدرة النموذج على أداء المهام المطلوبة. وقد تم تطبيق معيار نجاح 80% على النموذج مثلما هو مطبق على كل مرشح بشري، مما يضمن موثوقية الأداء.

بالاعتماد على مجموعة بيانات مكونة من 14 ورقة امتحانية، وجدنا أن النموذج لم يتمكن من تحقيق نسبة نجاح في البداية، إذ حقق 51.94% عند الاختبار الأولي. ومع ذلك، فإن استخدام تقنيات تحسين مثل التحسين الموجه والإضافات المعرفية أدى إلى تحسين الأداء، ليحقق 80.23% على اختبارات معينة.

تظهر النتائج أن النموذج يقترب من مستوى الكفاءة المطلوبة لتشغيل المفاعلات النووية، وهو ما يمثل تقدمًا ملحوظًا في استخدام الذكاء الاصطناعي في مجالات السلامة الحرجة. ومع ذلك، لا يزال هناك حاجة لمزيد من التحسينات، مما يثير تساؤلات حول المستقبل القريب لتطبيقات الذكاء الاصطناعي في الأهداف الحساسة.