تُعتبر تقنيات التعلم التعزيزي (Reinforcement Learning) من الابتكارات الحديثة التي تترك أثرًا كبيرًا في مجالات متعددة، ومنها فيزياء النيوترونات. في العادة، تعتمد تجارب فيزياء النيوترونات على استقطاب الأهداف بشكل ديناميكي، مما يتطلب ضبط تردد الموجات الدقيقة بشكل مستمر لتعويض الأضرار الناتجة عن الإشعاع وتطور خصائص المواد. هذه المهام كانت تُنفذ تقليديًا من خلال التجربة والخطأ بواسطة مشغلين محترفين.

لكن الدراسة الجديدة تقدم إطار عمل مبتكر يستند إلى البيانات، يجمع بين النمذجة البديلة (Surrogate Modeling) والتعلم التعزيزي لتحسين استقطاب الأهداف. باستخدام بيانات تشغيل حقيقية من نظام الهدف المجمد APOLLO، تم تدريب وتقييم نماذج متعددة الطبقات من perceptron ونماذج الانحدار القائمة على العمليات الغاوسية (Gaussian Process) لتوقع الاستقطاب كدالة لتردد الموجات الدقيقة، والتيار الجزيئي، وجرعة الإشعاع المتراكمة.

أظهرت النتائج أن النماذج القائمة على العمليات الغاوسية توفر تقديرات موثوقة للشكوك، وتسهل تحديد المناطق خارج توزيع التدريب، في حين أن نماذج MLP تظهر حساسية محدودة تجاه تغييرات التوزيع.

لتمكين التعلم والتحكم عبر عينات أهداف متعددة، تم تقديم تقريبا مستندًا إلى العمليات الغاوسية ودمج النموذج البديل داخل بيئة المحاكاة الموحدة.

تم تدريب وكيل التعلم التعزيزي باستخدام صيغة مكافأة تعتمد على حدود الثقة المنخفضة، مما يحقق توازنًا بين تعظيم الأداء والشكوك المرتبطة به. ومن المثير للاهتمام، أننا أظهرنا تحسنًا يقارب الضعف في أداء المشغلين باستخدام وكيل التعلم التعزيزي الخاص بنا.

هذه النتائج لا تمثل فقط تقدمًا تقنيًا في مجال فيزياء النيوترونات، بل تدل أيضًا على المستقبل الواعد لاستخدام تقنيات التعلم الآلي لتحسين عمليات معقدة.