في عالم الذكاء الاصطناعي، يعد تدريب وكلاء التعلم المعزز (Reinforcement Learning) على أداء المهام المعقدة تحديًا كبيرًا. في إطار هذا السياق، أُجريت دراسة جديدة تتناول كيفية تمكين هؤلاء الوكلاء من اتباع تعليمات زمنية متعددة عبر نماذج منطقية خطية (Linear Temporal Logic) في بيئات غير رمزية.
تحاول هذه الدراسة تجاوز الافتراضات غير الواقعية التي تستخدمها الدراسات السابقة والتي تستند غالبًا إلى معرفة العلاقة بين المشاهدات الخام والرموز الموجودة في المعادلات. بدلاً من ذلك، يقترح الباحثون نموذجًا مشتركًا لتدريب سياسة متعددة المهام وممارس للرموز باستخدام نفس الخبرات.
المثير في الأمر هو أن ممارسة الرموز تعتمد فقط على الملاحظات الخام والمكافآت النادرة من خلال ما يُعرف بماكينات المكافآت العصبية (Neural Reward Machines) بطريقة شبه إشرافية.
تمت تجربة هذا النهج في بيئات تعتمد على الرؤية، وتبين أن الأداء المحقق يضاهي الأداء الذي يمكن تحقيقه عند استخدام الرموز الحقيقية، بل ويفوق بكثير الأداء الذي حققته الأساليب السابقة في تعلم المهام المتعددة التي لا تفترض معرفة الرموز الحقيقية.
هذا التطور يمثل خطوة هامة نحو تحسين كيفية تفاعل الوكلاء الذكيين مع بيئاتهم، مما يفتح الأبواب أمام تطبيقات جديدة وإمكانيات هائلة في عالم الذكاء الاصطناعي.
استكشاف حدود التعلم المعزز: تمكين المهام الزمنية في بيئات غير رمزية!
تقدم هذه الدراسة طريقة مبتكرة لتدريب وكلاء التعلم المعزز لمتابعة تعليمات زمنية متعددة في بيئات غير رمزية. النتائج تشير إلى تحقيق أداء متفوق عند التكيف مع المهام دون الحاجة إلى معرفة الرموز الأساسية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
