شهدت الأبحاث في الذكاء الاصطناعي قفزات نوعية، وآخرها نموذج Gemma 4 31B-IT الذي تم تقييمه في سياق حاسم للغاية للسلامة، وهو امتحان الترخيص للعاملين بالمفاعلات النووية.
تتكون هذه الدراسة من تقييم شامل للنموذج الذي يحمل 31 مليار معلمة، حيث تم تطبيق معايير صارمة تقيس قدرة النموذج على أداء المهام المطلوبة. وقد تم تطبيق معيار نجاح 80% على النموذج مثلما هو مطبق على كل مرشح بشري، مما يضمن موثوقية الأداء.
بالاعتماد على مجموعة بيانات مكونة من 14 ورقة امتحانية، وجدنا أن النموذج لم يتمكن من تحقيق نسبة نجاح في البداية، إذ حقق 51.94% عند الاختبار الأولي. ومع ذلك، فإن استخدام تقنيات تحسين مثل التحسين الموجه والإضافات المعرفية أدى إلى تحسين الأداء، ليحقق 80.23% على اختبارات معينة.
تظهر النتائج أن النموذج يقترب من مستوى الكفاءة المطلوبة لتشغيل المفاعلات النووية، وهو ما يمثل تقدمًا ملحوظًا في استخدام الذكاء الاصطناعي في مجالات السلامة الحرجة. ومع ذلك، لا يزال هناك حاجة لمزيد من التحسينات، مما يثير تساؤلات حول المستقبل القريب لتطبيقات الذكاء الاصطناعي في الأهداف الحساسة.
نموذج لغوي متعدد الأنماط يتحدى امتحانات تشغيل المفاعلات النووية: استراتيجيات التحليل والتطوير
استعرضنا أداء نموذج Gemma 4 31B-IT متعدد الأنماط في امتحان الترخيص للعاملين بالمفاعلات النووية، حيث حقق نتائج مثيرة تتخطى الـ80% في بعض الاختبارات. هذا التطور يعد خطوة كبيرة نحو تطبيق الذكاء الاصطناعي في مجالات السلامة الحرجة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
