تُعتبر سلامة الذكاء الاصطناعي قضية محورية تزداد أهمية مع تطور الأنظمة المستقلة التي تستطيع تنفيذ الأكواد والتلاعب بالملفات وإرسال الرسائل. في هذا السياق، يبدو أن النموذج السائد الذي يعالج سلامة AI كخاصية يتم زرعها خلال تدريب النموذج، مثل التعلم المعزز مع تغذية راجعة بشرية (RLHF) أو نماذج الذكاء الاصطناعي الدستورية (Constitutional AI)، غير كافٍ لضمان سلامة الوكلاء.

يجب أن تكون سلامة الوكلاء جزءًا من عقد وقت التشغيل (Runtime Contract) يُفرض من خلال نظام الحماية، ويتكون هذا العقد من وجهين مكملين له.
- الوجه الوقائي: حيث يتم منع الأفعال الخطرة قبل حدوثها باستخدام صناديق الرمل (Sandboxes)، وقرارات الإذن، ومرشحات المخرجات، ومراقبة المسارات.
- الوجه الإيضاحي: الذي يتطلب إثباتًا يمكن التحقق منه بأن الأفعال الجيدة قد وقعت بالفعل، مع حاجز لمهام التقديم يعتمد على أدلة قوية مثل الاختبارات المسجلة، وأرشفة السجلات، واختلافات الملفات، وتوجيه الاستشهادات.

يدعم هذا الموقف ببرهان عام قوي من خلال أربع خطوط، تتضمن مسحًا لـ 52 حادثة سلامة لوكلاء الذكاء الاصطناعي ونماذج اللغات الضخمة (LLM)، وتدقيقًا لمكالمات غير صحيحة مع 31 حالة أساسية غير متنازع عليها وحالة توضيحية واحدة مثيرة للاختلاف. كما تم إجراء تدقيق لنظام المسار على 12 نظام وكيل عام ووسائل الحماية، وتقييم إضافي لـ 28,560 ورقة بحثية تم قبولها في مؤتمرات NeurIPS وICML وICLR للفترة 2023-2025، مما يدلل على وجود عدم توازن واضح بين النشر في وقت التدريب ووقت التنفيذ.

لكي تضمن سلامة الذكاء الاصطناعي، يمكننا الاستفادة من المجتمعات السابقة التي فرضت شروط سلامة، مثل أمن الكمبيوتر والعلوم التجريبية، حيث قامت هذه المجتمعات بالانتقال إلى عقود وقت التشغيل التي تشمل العناصر الوقائية والإيضاحية.

لذا، فالتطوير المستقبلي في مجال الذكاء الاصطناعي الوكيل يتطلب اعتماد نموذج "مسار الوكيل" وسلسلة أدلة واضحة، حيث يمثل العنصر الصحيح للسلامة في الذكاء الاصطناعي الوكلي هو المسار مع أدلة يمكن التحقق منها، وليس النموذج بحد ذاته.