في عالم الذكاء الاصطناعي، يُعتبر حل مشاكل التوجيه أمرًا جوهريًا لعدة تطبيقات حقيقية، ولكن غالبًا ما تتسم تلك المشاكل بتعقيدها (NP-hard) مما يجعل التعامل معها تحديًا حقيقياً. بالرغم من وجود العديد من الطرق، إلا أن الحلول الهيولية (heuristics) غالبًا ما تمثل أفضل توازن بين الجودة والقدرة على التوسع، مما يجعلها مناسبة للاستخدام الصناعي.

يأتي التعلم المعزز (Reinforcement Learning - RL) كإطار مرن لتصميم هذه الحلول، لكن تبقى إمكانية تطبيقه مقارنةً بالحلول اليدوية غير مكتملة، حيث تفتقر الطرق المتعلمة الحالية إلى قدرة ملحوظة على التكيف مع الحالات المحددة واستغلال الموازنة المتاحة بشكل كامل.

تحتوي الحلول الأفضل الحالية عادةً إما على مجموعة من السياسات المدربة مسبقًا، أو تعتمد على ضبط التعلم المعزز، مما يفشل في الاستفادة بشكل كامل من المعلومات المتاحة حديثًا في حدود الميزانية.

استجابةً لذلك، نقدم MEMENTO، نهج يستخدم الذاكرة لتحسين عملية البحث في الحلول الشبكية أثناء الاستدلال. يعتمد MEMENTO على بيانات أونلاين تم جمعها عبر محاولات متكررة لتعديل توزيع الإجراءات ديناميكياً استنادًا إلى نتائج القرارات السابقة.

لقد أثبتت الدراسات فعاليته مع مشاكل مثل بائع السفر ومشاكل توجيه المركبات المحدودة، موضحة تفوقه على طرق البحث الشجري وتقنيات تحسين السياسات. كما أنه يظهر قدرة على الدمج بدون أي تدريب مسبق مع حلول قائمة على التنوع.

تمكنا من تدريب جميع الحلول الذاتية ذات التعلم المعزز على الحالات الكبيرة والتحقق من قابلية MEMENTO للتوسع وكفاءته في استخدام البيانات، مما يحقق طفرة في النتائج في 11 من أصل 12 مهمة تم تقييمها.

في النهاية، يبشر MEMENTO بالتقدم الكبير في كيفية التعامل مع مشاكل التوجيه، مما يفتح آفاق جديدة للتطبيقات الصناعية والممارسات اليومية. ما رأيكم في هذا التطور الرائع؟ شاركونا في التعليقات!