شهدت مجالات الذكاء الاصطناعي وثقافة التعلم المعزز (Reinforcement Learning - RL) تطورًا ملحوظًا في الأساليب المستخدمة لضمان سلامة الأنظمة. إن تقنية الحماية المعروفة باسم "الشيلدنگ" أصبحت أداة أساسية لضمان أن تظل أفعال الوكلاء ملتزمة بالمواصفات الرسمية المحددة. ومع أن الأساليب التقليدية للشيلدنگ تضمن السلامة وفق افتراضات متعارف عليها، إلا أنها لا تتكيف مع التغيرات في بيئة العمل عندما يتم اختراق تلك الافتراضات.
تقدم هذه الورقة إطار عمل للتكيف في الحماية يعتمد على مواصفات إعادة النشاط من الرتبة الأولى (Generalized Reactivity of rank 1 - GR(1))، وهو جزء معبر وقابل للتحليل من المنطق الزمني الخطي (Linear Temporal Logic - LTL) الذي يجمع بين خصائص السلامة والفعالية. يعتمد هذا الأسلوب على اكتشاف الانتهاكات الافتراضية لوقت التنفيذ، ويستخدم برمجة المنطق الاستقرائي (Inductive Logic Programming - ILP) لإصلاح مواصفات GR(1) بشكل آلي وفوري، مما يضمن تطور الشيلد بشكل سلس ويعزز من إمكانية تحقيق الفعالية دون التأثير على الأهداف إلا عند الضرورة.
من خلال دراستين حاليتين، وهما Minepump وAtari Seaquest، أثبتت نتائجنا أن الشيلدات الرمزية الثابتة عادة ما تكون أقل فاعلية عندما يتعلق الأمر بتحقيق المكافآت الإضافية، بينما تظل الوكلاء المُزودين بالشيلد التكيفي لدينا قريبة من المستوى الأمثل في المكافآت، مع التزام تام بالمواصفات الإيجابية مقارنة بالشيلدات الثابتة.
بدون أدنى شك، يعكس هذا الأبحاث حدود الشيلدات التقليدية ويظهر كيف يمكن أن توفر الحلول الديناميكية تحسينات ملحوظة في أداء أنظمة التعلم المعزز وتساهم في تعزيز سلامتها.
إصلاح المواصفات التكيفية GR(1) لتعزيز الأمان والفعالية في التعلم المعزز!
تقدم هذه المقالة إطار عمل مبتكر يستخدم إصلاح المواصفات التكيفية لتعزيز الأمان في أنظمة التعلم المعزز. يضمن الأسلوب الجديد التكيف الفوري مع تغيرات البيئة مع الحفاظ على قواعد الأمان.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
