في عالم الذكاء الاصطناعي، تستمر الأساليب القائمة على البيانات مثل التعلم بالمحاكاة (Imitation Learning) والتعلم المعزز (Reinforcement Learning) في تحقيق إنجازات رائعة، إلا أن هذه الأساليب لا تخلو من التحديات. غالبًا ما تعاني من مشكلات عدم الاستقرار في التحكم وكذلك قضايا في المتانة عند تطبيقها في السيناريوهات الواقعية مثل الروبوتات والقيادة الذاتية، مما يثير تساؤلات حول مدى كفاءتها في الحياة اليومية.
تستند المشكلة بشكل كبير إلى قيود هذه الأساليب، حيث تعتمد فقط على الإشراف وتحسين الإجراءات من الدرجة الصفرية (زيروث-أوردر) أي تسميات الإجراءات، دون مراعاة ديناميكيات الإجراءات من الدرجة الأعلى (هاير-أوردر) والتناسق الزمني.
تقدم الدراسة الجديدة حلاً مبتكرًا يطرح مفهوم الإشراف المتزامن على الإجراءات من الدرجة الصفرية والأولى. من خلال تقديم نظام خسارة جديد مدعوم بضمانات نظرية رسمية، يمكن تجهيز أي نموذج سياسات متاح (مثل النماذج الحتمية، والعشوائية، أو تدفقات السياسات)، دون الحاجة إلى تعديلات هيكلية.
تتميز هذه الطريقة أيضاً بكونها وحدة خفيفة الوزن يمكن دمجها بسهولة في مجموعة واسعة من أطر التعلم المعزز غير المتصل (Offline RL). وقد أظهرت التقييمات الشاملة على OGBench وD4RL أن هذه الطريقة لا تعزز فقط الأداء والمتانة ولكنها تُحسن أيضًا من قدرة النماذج على التعميم خارج نطاق التوزيع (Out-of-Distribution) في سيناريوهات البيانات القليلة.
إنها خطوة واعدة للمساعدة في مواجهة تحديات التحكم في العالم الحقيقي، مما يجعلها أداة مثالية لمواجهة العديد من المشاكل المعقدة.
تحكم متفوق في الإجراءات: طريقة جديدة لتعزيز أداء السياسات في الذكاء الاصطناعي
توفر دراسة جديدة مقاربة مبتكرة لتحسين الكفاءة والثبات في سياسات التعلم الآلي من خلال التحكم في الإجراءات ذات الترتيب الأعلى. هذه الطريقة تعد بمثابة نقلة نوعية للتطبيقات العملية في مجالات متعددة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
