في عالم المراقبة الأرضية، تتنافس الأقمار الصناعية المرنة (Agile Earth Observation Satellites) اليوم مع تحديات جدولة المهام تحت قيود معينة تتعلق بالنوافذ الزمنية للرؤية ومتطلبات المناورة واستهلاك الطاقة. ولكون الأقمار الصناعية تختلف في capabilities (القدرات) والموارد المتاحة، قد تختلف النوافذ الزمنية المتاحة لنفس المهمة، مما يجعل عملية النمذجة الموحدة والتتحسينات الفعالة أمراً صعباً.

لتجاوز هذه التحديات، تم اقتراح إطار عمل جديد يمتاز بتوجيه تحسين السياسات باستخدام التعلم المعزز (Reinforcement Learning) بما يتلاءم مع الأهداف القابلة للتعديل. حيث يتم دمج الترميز غير المباشر القائم على التعيين مع تقييم التكلفة المعادلة القائم على فك الشيفرات للحفاظ على متطلبات القيود بينما يتحقق توازن بين كسب المهام وتوفير الطاقة.

وفي طبقة التحسين، تم فصل فك الشيفرات عن البحث القائم على السكان والتحكم في الممثل عبر الإنترنت، مما يتيح للتعلم المعزز اختيار عوامل البحث عالية المستوى بدلاً من بناء الجداول الزمنية مباشرة.

تم تطوير خوارزمية تفاعلية متكاملة مدعومة بالتعلم المعزز من خلال اختيار العوامل (RLOSMEA) وذلك لتنسيق الاستكشاف العالمي واستعادة الجدولة بشكل فعال تحت ميزانية تقويم محدودة.

تظهر التجارب على سيناريوهات متنوعة من الأقمار الصناعية مرنة أن (RLOSMEA) تحقق فائدة إجمالية أعلى وتأثيراً أكثر استقراراً من الأساليب القياسية المستخدمة. ولقد أكدت تحليلات السلوك القابلي للشفافية وقوة الاقتراح على فعالية هذا الأسلوب المدعوم بالتعلم المعزز.

من المثير حقاً رؤية كيف يمكن أن تُعزز هذه المشاريع تقنيات الفضاء وتحقق نتائج ملموسة في كيفية استغلال البيانات والمراقبة.