تتزايد التحديات المرتبطة بالتوجيه الكامل لوكلاء الذكاء الاصطناعي (AI Agents) مع تزايد طول فترة تشغيلهم، مما يجعل ضبط حدود سلطتهم أمرًا بالغ الأهمية. كل إجراء يتخذه الوكيل يؤثر على الحالة، وبالتالي على مسار الأفعال المستقبلية. إذا لم يكن الوكيل متطابقًا (Aligned)، فإن ضمان السلامة يتطلب الموافقة على الأفعال المترتبة قبل السماح بتنفيذها، وهو ما يشكل صعوبة تتمثل في كون الموافقة البشرية على كل خطوة تُعتبر نقطة اختناق.

يؤدي تفويض المراجعة إلى وكلاء ذكاء اصطناعي آخرين إلى مواجهة المشكلة نفسها؛ إذ قد تكون الوكالات المراجعة نفسها غير متطابقة. في هذه الدراسة، نحدد شرطًا لمجموعة المراجعين يكون أضعف من التوافق الفردي ولكنه ضروري وكافٍ لضمان أن يؤدي ذلك إلى نتائج إيجابية يتجاوز توقعاتها السياسة الأساسية. بحيث يقدم كل وكيل مراجعة تقريراً حول مدى تحسن اقتراح الفعل بالنسبة لمنفعتهم الخاصة.

كذلك تم تقديم قاعدة عتبة تسمح بعدد محدد من الرفض، حيث تُعتبر هذه القاعدة آمنة تمامًا عندما يمكن كتابة منفعة المبدأ كتركيبة غير سلبية لمنافع المراجعين المتبقيين، بالإضافة إلى مصطلح غير سالب على كافة الاقتراحات الممكنة. نسمي هذه الخاصية "التوافق التعاوني المتين بمعدل k". وتجدر الإشارة إلى أن هذه التوصيفات تعود إلى التحكم التسلسلي، حيث تعتبر السلامة في كل حالة ضرورية وكافية لتتطابق السياسة المستجدة أو لتحسينها عن السياسة الأساسية.

عندما يصوت المراجعون بشكل استراتيجي، فإن تغطية كاملة لمساحة وظيفة المكافأة تضمن أن تكون كل نقطة توازن (Nash Equilibrium) آمنة تحت قاعدة الموافقة بالإجماع؛ على النقيض، فإن العتبات الأكثر تساهلاً قد تقبل نقاط توازن غير آمنة حتى عندما يكون المراجعون متوافقين بشكل فردي. تظهر التجارب مع نماذج المراجعين الحالية أن المراجعة الجماعية يمكن أن تبقى صحيحة بدون وجود فرد متوافق، حتى عند tolerating بعض الرفض.

مع تقدم التكنولوجيا، يظل فهم كيفية ضمان سلامة قرارات الذكاء الاصطناعي أمرًا حيويًا للجميع. ما هي آراؤكم حول هذه التطورات وما التحديات التي تتوقعون رؤيتها؟ شاركونا في التعليقات!