في عالم الذكاء الاصطناعي، تزداد نماذج اللغات الضخمة (LLMs) تعقيدًا، مما يسمح لها بالاعتماد على مهارات قابلة لإعادة الاستخدام لتنفيذ مهام متعددة الخطوات. ومع ذلك، تنشأ أزمة خطيرة تتعلق بالأمن، إذ يمكن استغلال محتوى المهارات المسمومة للتأثير على قرارات الوكلاء الذكيين تحت طلبات تبدو بريئة.
توضح الأبحاث الحالية وجود فجوات في الآليات المصممة لحماية هذه النماذج، حيث تركز الهجمات السمومية المعروفة على الربط بين دوافع التنفيذ والمهام المتعددة، ولا تفصل بوضوح بين أسباب التنفيذ وعملياته.
في إطار ورقتها الجديدة، تبرز مجموعة من الباحثين أن القرارات غير الموثوقة للوكيل تعتمد على عاملين متميزيين: عامل التنفيذ (الذي يحدد العملية الملموسة التي يتم إنجازها) وعامل المقدم (الذي يقدم المبرر الظرفي لتنفيذ تلك العملية). يقدم الباحثون استراتيجية جديدة قائمة على التنسيق للفصل بين هذين العاملين، حيث يحتفظون بعامل التنفيذ كمهمة قائمة بذاتها بينما يقومون بنقل دور المبرر إلى مهارة تمهيدية أخرى تقوم بتعديل البيئة المحيطة بطريقة تبدو طبيعية.
هذا الأسلوب يتيح لعمليات التنفيذ أن تظهر بشكل شرعي وتستند إلى مبررات مصطنعة.
علاوة على ذلك، طوّر الباحثون إطار عمل آليًا يكشف الروابط التبادلية الحقيقية، ويجمع بين المهارات المسمومة بنجاح من خلال القيام بعمليات إعادة ضبط مستمرة.
النتائج أظهرت فعاليات مرتفعة في الهجمات، مما يسلط الضوء على نقطة ضعف حرجة في فحوصات أمان المهارات المعزولة.
لمزيد من التفاصيل، يمكنك الاطلاع على الكود الخاص بإطار العمل الآلي عبر GitHub.
كشف النقاب عن أسلوب جديد لهجمات السموم المهارية في نماذج الذكاء الاصطناعي!
تستعرض ورقة بحثية جديدة طريقة مبتكرة لاستغلال الثغرات في نماذج الذكاء الاصطناعي من خلال فصل دوافع التنفيذ عن العمل الفعلي. هذا الكشف يسلط الضوء على خطر الهجمات السمومية المهارية ويقدم طريقة جديدة للتصدي لها.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
