تتزايد تأثيرات نماذج اللغات الضخمة (LLMs) في بيئات متعددة، مما يعرضها لمخاطر إساءة الاستخدام من عدة مصادر. تختلف الهجمات التي تتعرض لها هذه النماذج، مثل هجمات التفكيك، حيث يُقسم الطلب الضار إلى طلبات غير مؤذية، وهجمات حقن المطالبات، حيث يؤدي أداة مخترقة تعليمات خبيثة.
بدلاً من التعامل مع هذه التهديدات بشكل منفصل، اقترح الباحثون نظاماً لمراقبة استجابات الوكلاء (agents) التي يمكن أن تسلط الضوء على أول إشارة للإساءة. يتطلب هذا النظام التعرف على "نافذة الضرر"، وهي الفترة الزمنية التي تسبق تنفيذ الهدف الضار.
لتحقيق هذا الهدف، تم تطوير إطار عمل موحد لمراقبة إساءة الاستخدام على مستوى آثار المحادثة، باستخدام مجموعة تحتوي على حوالي 6200 محادثة بين المستخدم ووكيلي LLM والبيئة الخارجية. تم تصنيف هذه المحادثات لتحديد إطار الضرر العملي ومطابقة حالات الامتناع عن الاستجابة لتلك الطلبات.
أظهرت النتائج أنه عبر 17 تكوين للمراقبة، حققت المراقبات المعتمدة على التصرفات نجاحاً ملحوظاً في مواجهة التهديدات المختلفة. بينما انهارت المراقبات المعتمدة على المحتوى أمام هجمات الحقن، حيث أخفقت في تحديد تلك الهجمات بدقة. يُبرز هذا البحث الحاجة الملحة لدراسة موحدة في مجال مراقبة إساءة الاستخدام، مما يعزز من فهمنا لكيفية تأمين نماذج الذكاء الاصطناعي وتحسين ثقتها في المجتمع.
نحو إنشاء معيار موحد لمراقبة إساءة الاستخدام في نماذج الذكاء الاصطناعي
تقدم الدراسة مقاربة جديدة لمراقبة إساءة استخدام نماذج اللغات الضخمة (LLMs) من خلال معيار موحد يُحلل تأثير الهجمات المختلفة في بيئات متعددة. هذا التطور يعد خطوة هامة نحو تحسين الأمان والثقة في تقنيات الذكاء الاصطناعي.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
