تعتبر نماذج اللغة المستخدمة للأدوات (Tool-using Language-Model Agents) من التقنيات الحديثة في الذكاء الاصطناعي، حيث يمكنها اتخاذ قرارات حول الأفعال المسموح بها وتنفيذها بعد تغيير حالة الأمان ذات الصلة. وللإجابة على التحديات المتعلقة بالفجوة بين الاقتراح والالتزام، أُدخلت آلية جديدة تدعى BSC-R، وهي آلية قائمة على الحدود التأثيرية (Effect-Boundary Mechanism) التي تربط التفويض بعملية الالتزام الخاصة بفعل معين مع تصور دلالي للحالة التي تبرره.

في دراسة جديدة شملت 2847 حلقة من AgentDojo، أثبتت هذه الآلية أنها لا تؤثر على سلوك الوكيل غير المحمي، حيث حققت نسبة فائدة بلغت 80.576٪ ونسبة نجاح في الهجمات قدرها 1.616٪. وفي 10,302 اقتراح مجمد، وافقت الآلية على جميع الالتزامات غير المتغيرة، بينما رفضت أي تغيرات أو حالات تم إعادة تشغيلها.

عند إجراء تجربة مستقلة بشأن تحولات الحدود، تم تسجيل عدم وجود أي التزامات غير صحيحة في سياقات محددة، مع الحفاظ على 5899 من السياقات الصالحة. بالإضافة إلى ذلك، أظهرت تقييمات خارجية مختلفة احتفاظ الأسلوب الجديد بجميع الحالات الحميدة ومنع 1200 حالة من الآثار غير الصالحة المعروضة، مع التعامل بشكل صحيح مع جميع دورات إعادة التشغيل.

رغم النجاح الملحوظ، أظهرت النتائج في السلسلة الأوسع وجود معدل التزام غير صالح بنسبة 25٪ للآلية BSC-R مقابل 0٪ لسلسلة CONTINUITY. وبالتالي، يمكن اعتبار هذه الآلية أداة مهمة لضمان دقة الالتزام في الأوقات الحرجة، لكنها لا تقدم ادعاءً شاملاً حول أمان الوكلاء.

في ضوء هذه الأبحاث، يتعين علينا التفكير بعمق حول كيفية تعزيز الأمن في أنظمة الذكاء الاصطناعي. ما رأيكم في هذه التطورات المثيرة؟ شاركونا في التعليقات!