تعتبر نماذج التعلم القائم على التفضيلات (Preference-based Reinforcement Learning) بديلًا واعدًا لتصميم المكافآت المعتمدة على الفرضيات (heuristic reward design) في بيئات الروبوتات المعقدة. إلا أن هذه النماذج غالبًا ما تعاني من ضعف كفاءة العينات، مما يتطلب تغذية راجعة واسعة ومكلفة من البشر، وهذا ما يحد من قابلية تطبيقها في العالم الحقيقي.
في السابق، تم اقتراح تعلم نموذج مكافأة من خلال التحليلات التجريبية ثم تحسينه باستخدام التفضيلات. لكن، مع تحول النموذج إلى شبكة عصبية، غالبًا ما يؤدي الانتقال بين دوال الخسارة المختلفة خلال مراحل التدريب إلى عدم استقرار في التحسين وتدهور الأداء.
في هذا البحث، نقدم طريقة فعالة للاستفادة من المعرفة السابقة باستخدام نموذج المكافأة المتبقية (Residual Reward Model - RRM). يقضي نموذج المكافأة المتبقية بأن المكافأة الحقيقية للبيئة يمكن فصلها إلى جزئين: مكافأة سابقة ومكافأة متعلمة. حيث تكون المكافأة السابقة عبارة عن مصطلح متوفر قبل التدريب، مثل تخمين هندسي “الأفضل تخمين” أو مكافأة مولدة لغويًا، أو دالة مكافأة تعلمت من التعلم العكسي. بينما يتم تدريب المكافأة المتعلمة باستخدام التفضيلات كتعويض متبقي.
تظهر النتائج التجريبية في Meta-World وDM-Control أن نماذج المكافأة المتبقية تحسن بشكل كبير من كفاءة العينات مقارنةً بمختلف أنواع المكافآت السابقة. وعلاوة على ذلك، نوضح الفعالية العملية لطريقتنا على روبوت Franka Panda الفعلي، حيث يتم تسريع تعلم السياسات وتحقيق معدلات نجاح عالية في خطوات أقل من المعايير التقليدية.
قد تكون هذه التطورات قادرة على تغيير طريقة تطوير الروبوتات وتعزيز قدرتها على العمل بكفاءة أكبر في بيئات معقدة. ما رأيكم في هذا التطور؟ شاركونا في التعليقات!
نموذج المكافأة المتبقية: تعزيز كفاءة التعلم القائم على التفضيلات في الروبوتات بإستخدام المعرفة السابقة!
في سعيها لتحقيق تحسينات في التعلم القائم على التفضيلات في الروبوتات، تقدم هذه الدراسة نموذج المكافأة المتبقية (Residual Reward Model) كحل مبتكر يعزز كفاءة استخدام العينات. هذه التقنية الجديدة تزيد من فعالية التعلم وتقلل من الحاجة للتغذية الراجعة المكلفة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
