مع التوسع السريع في الاقتصاد منخفض الارتفاع، أصبحت الطائرات بدون طيار (UAVs) أساسًا رئيسيًا لمنصات التواصل الجوية، حيث تدعم خدمات متنوعة بدءًا من المهام الحساسة في استجابة الزمن إلى بث البيانات ذو النطاق الترددي العالي. إلا أن فعالية هذه الشبكات المتنوعة غالبًا ما تتعرض للخطر بسبب التضارب بين الموارد المحدودة على متن الطائرات ومتطلبات الاستقرار الصارمة.

تجاوزًا للتصاميم التقليدية التي تركز على معدل الإنتاجية، نقترح إطار عمل مغلق للاتصالات والحسّ والتحكم، حيث يتم نمذجة تأثير زمن الاتصال على استقرار التحكم الفيزيائي. لضمان موثوقية المهام، نستفيد من نظرية استقرار لايابونوف (Lyapunov stability theory) لنشتق خريطة داخلية تربط بين تطور حالة نظام التحكم وقيود الاتصال، محولين متطلبات الاستقرار التجريدية إلى حدود كمية قابلة للقياس.

ثم، نصوغ مشكلة توزيع الموارد كلعبة ستاكيلبرغ (Stackelberg game)، حيث تعمل الطائرات بدون طيار كقادة، تحدد أسعار الموارد بطريقة ديناميكية لتحقيق توازن الحمل وضمان الاستقرار، فيما يقوم المستخدمون كتابعين بتحسين الطلبات بناءً على مدى أهمية الخدمة.

علاوة على ذلك، ولمواجهة العبء الحسابي الكبير الذي تسببه أساليب التعلم العميق التقليدية (Deep Reinforcement Learning - DRL) على المنصات الحدية ذات الطاقة المحدودة، نقدم خوارزمية مبتكرة وخفيفة تعتمد على التقليم لتحسين السياسة القريبة (Proximal Policy Optimization - PPO). من خلال دمج آلية تقليم منسقة ديناميكيًا، تتيح الخوارزمية المقترحة ضغط حجم الشبكة العصبية أثناء التدريب، مما يمكن الطائرة بدون طيار من الاقتراب بسرعة من توازن اللعبة مع حد أدنى من زمن الاستجابة.

تظهر نتائج المحاكاة أن النظام المقترح يضمن استقرار حلقة التحكم بينما يعمل على زيادة فائدة النظام في بيئات منخفضة الارتفاع الديناميكية.