تُعد المهمات البحرية، مثل عمليات البحث والإنقاذ والمراقبة البيئية، معقدة للغاية بسبب الحاجة إلى تخصيص موارد الاستشعار بفعالية عبر مساحات شاسعة ذات أشكال هندسية معقدة. على الرغم من أن استراتيجيات تخطيط المسارات التقليدية تعتمد على تقنيات التفكيك، إلا أنها تواجه تحديات عديدة عندما يتعلق الأمر بالسواحل غير المنتظمة والجزر والمناطق المحظورة. \n\nهنا يأتي دور الابتكار المذهل في إطار عمل التعلم العميق دون انتقادات (Critic-Free Deep Reinforcement Learning) الذي نقترحه، والذي يحل مشكلة تخطيط المسار عبر تمثيلات الشبكات السداسية (hexagonal grids) للأماكن البحرية غير المنتظمة. بدلاً من الأساليب التقليدية، نحن بصدد صياغة المشكلة كمسألة تحسين تجميع حاد باستخدام سياسات تعتمد على الترانسفورمر (Transformers)، التي تقوم إنشائها بشكل تلقائي لتحديد مسارات التغطية. \n\nللتغلب على عدم استقرار تقدير القيم في المشاكل المتعلقة بالملاحة طويلة المدى، قمنا بتنفيذ مخطط تحسين السياسة النسبي الجماعي (Group-Relative Policy OptimizationGRPO) الذي يُقدِّر المزايا من خلال مقارنات ضمنية بين المسارات الموجودة بدلاً من الاعتماد على وظيفة القيمة التقليدية. \n\nتظهر التجارب على 1,000 بيئة بحرية صناعية غير مرئية أن السياسة المدربة تحقق معدل نجاح هاميلتوني (Hamiltonian success rate) بنسبة 99.1%، مما يزيد بمقدار الضعف مقارنة بأفضل أساليب heuristics (46.0%). والأكثر من ذلك، أن المسارات التي تم إنتاجها كانت أقصر بنسبة 7% وأقل تغييرًا في الاتجاهات بنسبة تصل إلى 24.1% مقارنة بأفضل معيار تقني قريب. \n\nتعمل جميع أوضاع الاستدلال (التجريبية، والعشوائية، واستدلال مع تحسين 2-opt) في أقل من 50 مللي ثانية لكل حالة على معالج رسومي للكمبيوتر المحمول، مما يؤكد إمكانية تنفيذها في الوقت الفعلي على متن السفن. \n\nإن هذا الابتكار يوفر حلاً مرنًا وفعالًا لتحديات العمليات البحرية المعقدة، مما يفتح آفاق جديدة في عالم ملاحة السفن وتخطيط المسارات.