هل سيكتشف المستخدم ما يحدث وراء الكواليس؟ كشف غموض الهجمات غير المباشرة على نماذج LLM باستخدام الأدوات
تظهر الدراسات الأخيرة أن الهجمات غير المباشرة على نماذج اللغات الكبيرة (LLM) قد تكون أكثر تأثيراً مما نتصور. اكتشف كيف يمكن لمثل هذه الهجمات أن تمر دون أن يلاحظها المستخدم، وتأثيرها على الأمان.
مع تزايد استخدام نماذج اللغات الكبيرة (LLM) لتنفيذ مهام متعددة في الواقع العملي، أصبح من الضروري فهم المخاطر المحتملة التي قد تطرأ نتيجة الهجمات غير المباشرة. فقد أظهرت دراسة جديدة كيفية تنفيذ هجمات خفية تُعرف باسم "الهجمات غير المباشرة" (Indirect Prompt Injection - IPI) والتي تهدد أمان أنظمة الذكاء الاصطناعي. تكمن المشكلة الرئيسة في أن مقاييس النجاح المعتمدة، مثل معدل نجاح الهجمات (Attack Success Rate - ASR)، تركز على نجاح الهجوم فقط بدون أن تأخذ بعين الاعتبار كيف يمكن أن يتفاعل المستخدم مع الردود النهائية. \n\nتشير النتائج المستخلصة من حالات الهجمات الناجحة إلى وجود نوعين مختلفين من النتائج: الأول هو الهجوم الخفي الذي ينفذ العملية بدون أن يُظهر أي علامة على ذلك في الرد النهائي للمستخدم، والثاني هو الهجوم الواضح حيث يبرز الإجراء المُدخل في الرد، مما يتيح للمستخدم فرصة اكتشافه. ونسمي هذين النوعين "النجاح الخفي" و"النجاح الواضح". وقد وضعت الدراسة مقاييس جديدة تعكس هذه النتائج: معدل النجاح الخفي (Covert Success Rate - CSR) الذي يعتبر النجاح الذي يترك خلفه لا شيء في الرد النهائي، ومعدل النجاح الواضح (Overt Success Rate - OSR) الذي يُحتسب من خلال النجاح القابل للاكتشاف من قبل المستخدم. \n\nمن خلال تحليل المسارات الناجحة، وجد الباحثون أن سلوك النموذج بعد تنفيذ الهجوم هو ما يفصل بين النتائج الخفية والواضحة. يمكن للأنماط الخفية أن تعيد زمام الأمور إلى مهمة المستخدم قبل انتهاء العملية، بينما تتوقف الأنماط الواضحة عند الهجوم نفسه. بناءً على هذه الملاحظة، قام الباحثون بتطوير هجوم جديد يُسمى "ICoA" (Induced Covert Attack) مصمم لتحفيز النتائج الخفية عبر إعادة توجيه النموذج إلى مهمة المستخدم بعد تنفيذ الهجوم. وقد أظهرت النتائج أن ICoA كان له أعلى معدل نجاح خفي، متفوقاً بزيادة تتراوح بين 3.79 إلى 12.01 نقطة مئوية مقارنة بأقوى معيار موجود. \n\nباختصار، تقدم هذه الدراسة نظرة مثيرة حول كيف يمكن للإجراءات الداخلية في نماذج الذكاء الاصطناعي أن تتجاوز تصورات المستخدم، مما يدعو إلى اتخاذ إجراءات وقائية لضمان أمان هذه الأنظمة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
