في عالم الذكاء الاصطناعي، يُعتبر التعلم المعزز (Reinforcement Learning) من المجالات الحيوية التي تتيح للنظم التعلم من تجربتها واتخاذ قرارات مبنية على تجارب سابقة. ولكن هل يمكن أن تجعل هذه السياسات (Policies) القابلة للتعلم أكثر شفافية وقابلية للفهم؟ في دراسة جديدة، ابتكر باحثون طريقة ثورية لإعادة كتابة سياسات التعلم المعزز بحيث تصبح منطقًا قابلًا للتنفيذ باستخدام بروغ (Prolog Expert Systems).

إحدى المشكلات الرئيسية التي تواجه علم التعلم المعزز هي أن السياسات المدربة تعتبر "صندوقًا أسود"، مما يعني أنها تتخذ قرارات صعبة الفهم للبشر. ولكن، ماذا لو استطعنا جعلها أكثر وضوحًا؟ قام الباحثون بتطوير آلية تقوم بثلاث مراحل، تبدأ باستخلاص المعلم (Teacher) من استراتيجية الاسترجاع القريبة، ثم تشكل قائمة قوانين مرتبة تستند إلى قراراته، وفي النهاية تصدر النتائج كبرنامج بروغ.

تمكنت هذه العملية من التأكيد على أربع ضمانات، منها الحد من فقدان العائد وعمل البرنامج كشهادة يمكن فحصها آليًا في عمليات اتخاذ القرار Markov. بالإضافة إلى ذلك، أظهرت نتائج تجريبية أن البرنامج المطور اتسم بدقة عالية في حل مهام معينة، مما يتجاوز بشكل فعال أداء المعلم الأصلي في بعض الحالات.

هذه الخطوة تعتبر تقدمًا كبيرًا في جعل الأنظمة الأكثر تعقيدًا في الذكاء الاصطناعي أكثر قابلية للفهم، مما يسهم في زيادة اعتماد الأفراد على تقنيات التعلم المعزز.