في عالم الذكاء الاصطناعي، يعد تدريب وكلاء التعلم المعزز (Reinforcement Learning) على أداء المهام المعقدة تحديًا كبيرًا. في إطار هذا السياق، أُجريت دراسة جديدة تتناول كيفية تمكين هؤلاء الوكلاء من اتباع تعليمات زمنية متعددة عبر نماذج منطقية خطية (Linear Temporal Logic) في بيئات غير رمزية.

تحاول هذه الدراسة تجاوز الافتراضات غير الواقعية التي تستخدمها الدراسات السابقة والتي تستند غالبًا إلى معرفة العلاقة بين المشاهدات الخام والرموز الموجودة في المعادلات. بدلاً من ذلك، يقترح الباحثون نموذجًا مشتركًا لتدريب سياسة متعددة المهام وممارس للرموز باستخدام نفس الخبرات.

المثير في الأمر هو أن ممارسة الرموز تعتمد فقط على الملاحظات الخام والمكافآت النادرة من خلال ما يُعرف بماكينات المكافآت العصبية (Neural Reward Machines) بطريقة شبه إشرافية.

تمت تجربة هذا النهج في بيئات تعتمد على الرؤية، وتبين أن الأداء المحقق يضاهي الأداء الذي يمكن تحقيقه عند استخدام الرموز الحقيقية، بل ويفوق بكثير الأداء الذي حققته الأساليب السابقة في تعلم المهام المتعددة التي لا تفترض معرفة الرموز الحقيقية.

هذا التطور يمثل خطوة هامة نحو تحسين كيفية تفاعل الوكلاء الذكيين مع بيئاتهم، مما يفتح الأبواب أمام تطبيقات جديدة وإمكانيات هائلة في عالم الذكاء الاصطناعي.