في عصر يتسم بالتطور السريع لتكنولوجيا الذكاء الاصطناعي، برزت أهمية التعلم المعزز (Reinforcement Learning) الذي يتعامل مع مهام تتغير ديناميكياً بعد نشر الأنظمة. تُظهر الدراسات أن إعادة تدريب سياسات التعلم لكل هدف جديد يُعد أمرًا مكلفًا للغاية. لكن عبر نموذجَي ميزات الخلافة (Successor Features) والتحسين العام للسياسات، يمكن دمج مكتبة من السياسات المتعلمة لتلبية أي هدف جديد، مع ضمان ألا تكون النتيجة أسوأ من أي سياسة في المكتبة.
ومع ذلك، لم تحظَ مسألة نقل التعلم بين الوكلاء المتعددين بنفس القدر من الاهتمام، حيث يُسمح لكل وكيل بإعادة دمج مكتبة سياساته الخاصة بشكل مستقل. تبين أن هذا يؤدي في بعض الأحيان إلى سلوك مشترك أسوأ من كل سياسات المكتبة، حيث أن إعادة دمج زملاء الفريق تغير البيئة التي يواجهها كل وكيل، مما يُفقده القيم الأساسية التي يعتمد عليها.
وفي محاولتهم لمعالجة هذه القضية، أثبت الباحثون أن القاعدة الثابتة الوحيدة الآمنة هي التجميع المتزامن، حيث ينتقل الفريق بالكامل إلى سياسة مدربة بشكل مشترك، لكن هذه الطريقة لا تلبي الأهداف التي تُعطي أهدافًا مختلفة لوكلاء مختلفين.
ولإيجاد حل لمشكلة الأمان والمرونة معًا، تم اقتراح نهج MA-USFA (Multi-Agent Universal Successor Features Approximator)، والذي يتكون من طبقتين: الطبقة السفلية تتوقع ميزات الخلافة الخاصة بكل وكيل مع مراعاة أهداف زملائه، بينما تُحدد الطبقة العليا أي إدخال من المكتبة يجب أن يتبعه كل وكيل، مما يوفر تصحيحًا عبر الوكلاء لا يمكن تمثيله من خلال قيمة وكيل واحد. هذا الأسلوب مدرب مرة واحدة فقط على توزيع الأهداف، ويمكن تطبيقه في وقت النشر دون الحاجة إلى تعديل لكل هدف.
السلامة في تجميع السياسات بين الوكلاء: إعادة تفكير في نقل ميزات الخلافة في التعلم المعزز التعاوني
تطرقت دراسة جديدة إلى التحديات التي تواجه أنظمة التعلم المعزز المتعددة الوكلاء في تعديل سياساتها بشكل آمن وفعال. تم اقتراح طريقة جديدة تُعرف باسم MA-USFA لتحقيق الأمان والمرونة في نقل ميزات السياسات المعتمدة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
