في عالم الذكاء الاصطناعي المتطور، يُعد تأمين الوكلاء الذكيين من المخاطر أمرًا بالغ الأهمية. وفي هذا السياق، ظهر مشروع جديد يُعرف بـ RePolicy، الذي يتيح تداول سياسات السلامة بشكل أكثر فعالية من خلال استخدام تقنيات التعلم التعزيزي (Reinforcement Learning). فما هو هذا النظام الذي يعد ثورة في حماية الوكلاء؟

تتطلب حماية نماذج اللغات (Language Models) تقييم كافة مسارات التنفيذ تحت سياسات السلامة المعتمدة على السياق. حتى الآن، كانت الأساليب المعتمدة على السياسات غالبًا ما تعتمد على التوجيه أو التحسين الخاضع للإشراف، مما يقيد قدرتها على التكيف مع العلاقات الجديدة والظروف المتغيرة.

يقدم نموذج RePolicy نهجًا مبتكرًا يحوّل كيفية استدعاء سياسات السلامة من خلال التعلم التعزيزي. حيث يقوم نموذج الوكيل بتحديد المسار الصحيح ويستدعي السياسة المناسبة من مكتبة السياسات الديناميكية، ويستخدم محتواها لإنشاء تفسير معتمد على السياسة وحدود الأمان.

بالإضافة إلى ذلك، تم تطوير مجموعة بيانات PolicyTraj-20K لدعم التهيئة الخاضعة للإشراف، تليها تقنيات مثل GRPO مع مكافآت يمكن التحقق منها واضطراب سياق السياسات.

أظهرت التجارب عبر ستة معايير سلامة للوكالات أن RePolicy حقق أداءً قويًا في الكشف عن المخاطر واستدعاء السياسات với نجاح ثابت في سياقات متعددة. هل يمكن أن يكون RePolicy هو الحل الذي كان ينقص عالم الوكالات الذكية لضمان المزيد من الأمان والثقة؟

فلتستقبلوا هذا الابتكار بحماس، وشاركونا آرائكم حول كيف يمكن أن يؤثر هذا التطور في المستقبل القريب!