تواجه الروبوتات تحدياً كبيراً عند محاولة اتباع أشخاص في الأماكن المزدحمة، حيث يتمثل هذا التحدي في الحفاظ على السلوك الآمن بينما يبقى الروبوت قريباً من الهدف. في السيناريوهات المكتظة، يصبح الخطر أكبر، إذ يمكن أن تؤدي المتابعة العدوانية إلى الاصطدامات، بينما تؤدي الأبعاد الحذرة إلى خسارة الهدف، خصوصاً عندما تكون سلوكيات المشاة غير مألوفة أو غير متوقعة.

على الرغم من أن الأساليب الحالية للتعلم المعزز (Reinforcement Learning) تستخدم مكافآت كثيفة واحدة لتمثيل الأهداف المتنافسة، إلا أن توازن الأمان والاقتراب لا يكون واضحاً بشكل كافٍ مما يجعل تعديله صعباً.

لذا، تم ابتكار طريقة جديدة تقسم مهمة متابعة الإنسان إلى مكافآت نادرة وقيود تكلفة مستقلة ضمن إطار التعلم المعزز متعدد القيود. تعمل هذه الطريقة على إدارة كل قيد من خلال حدود تكلفة ذات معنى سلوكي مباشر، مما يسمح بتحكم صريح وقابل للتعديل في التوازن بين الأمان والاقتراب.

بالإضافة إلى ذلك، تم قياس عدم اليقين في توقع حركات البشر، حيث يتم دمج هذه التقديرات ضمن تكاليف التعلم المعزز لتعزيز السلامة في الظروف غير المتوقعة. تجارب واسعة النطاق أظهرت أن هذه الطريقة تحقق توازنًا فعالًا بين الأمان والاقتراب مقارنةً بالأساليب التقليدية.

كما أثبتت التجارب على الروبوتات الحقيقية صلاحية هذه الطريقة في السيناريوهات الواقعية، مما يفتح آفاقاً جديدة لتطبيقات الروبوتات في الحشود.

استكشف المزيد حول هذا المشروع من خلال زيارة صفحتنا الرسمية: https://nav-ps-balance.github.io/