يُعد تعلم الشبكات الحساسة للوقت (Time-Sensitive Networking - TSN) جزءًا متزايد الأهمية في الحوسبة على الأطراف المتنقلة (Mobile Edge Computing - MEC)، خصوصاً في تعزيز التطبيقات التي تتطلب زمن استجابة سريع مثل الواقع الممتد (Extended Reality - XR). ومع ذلك، تعاني الحلول الحالية من الاعتماد على تقنيات التحسين الثابتة أو نماذج التعلم المركزية التي تستند إلى أنماط مرور ثابتة، مما يحد من فعاليتها في البيئات الديناميكية.

في العصر الحديث، تستضيف بيئات MEC عدة تدفقات مرور XR المتزامنة، والتي تتغير ميزاتها مع مرور الوقت، مما ينتج عنه تبعيات معقدة بين قوائم الانتظار لا تستطيع الجداول الحالية التعامل معها. للتغلب على هذه التحديات، يُعتبر اقتراح آلية جدولة لامركزية قادرة على التكيف مع مجموعة من ظروف الازدحام أمراً ضرورياً.

يقدم هذا البحث إطار عمل يعتمد على التعلم المعزز المتعدد الوكلاء (Multi-Agent Reinforcement Learning - MARL) لجدولة TSN، حيث يتم تصميم كل قائمة انتظار TSN كوكيل مستقل. يتم استخدام خوارزمية تحسين سياسة القرب غير المتجانسة (Heterogeneous-Agent Proximal Policy Optimization - HAPPO) لنمذجة التبعيات بين الوكلاء وتحسين عملية تقديم الخدمة عبر قوائم الانتظار المختلفة.

أثبتت نتائج المحاكاة أن النهج المقترح يقلل أوقات انتظار الإطارات بمعدل يصل إلى 26.8% والتأخيرات في أسوأ الحالات بحوالي 16.8%. هذا يكشف عن فعالية التكنولوجيا في سيناريوهات MEC الديناميكية المدفوعة بـ XR، مما يعزز من كفاءة التطبيقات المتقدمة.