في عالم الذكاء الاصطناعي، يُعتبر التكميم (Quantization) أحد المسارات الضرورية لنشر النماذج ذات الوزن المفتوح، لكنه يتضمن مخاطر كبيرة، حيث يمكن أن يتلاعب الخصوم بهذه العملية لخلق هجمات خلفية تهدف إلى تفعيل سلوكيات خبيثة بعد التكميم. تُعرف هذه الهجمات بهجمات خلفية مشروطة بالتكميم (Quantization-Conditioned Attacks - QCA).
تستند الأبحاث السابقة في هذا المجال إلى الأضرار التي تلحق بإنتاج نصوص حرة، حيث يكون الضرر متوسطاً من خلال القارئ البشري. لكن في البيئات التي تعمل فيها الوكالات الذكية، المستوى الخطر يرتفع بشكل كبير، حيث يمكن أن تُنفذ التعليمات الشريرة بدون إشراف بشري.
وفي هذا الإطار، تقدم دراسة جديدة الإطار الأول من نوعه AGENTQ، المبني على دمج تقنيات حقن LoRA مع إصلاح PGD الجزئي، مما يتيح لنا فهم حدود التهديد بشكل أوضح. اتضح أن الطريقة المتبعة لحقن الخبائث تنتج سلوكاً خبيثاً بعد التكميم، لكن فائدتها السليمة تنهار بدرجة كبيرة، مما يجعل الهجمات السابقة غير عملية.
يُظهر AGENTQ قدرة على الوصول إلى نسبة نجاح بلغت 100% بعد التكميم مع فقدان طفيف في المنفعة العادية، مما يسلط الضوء على أهمية جعل تقييم السلامة الواعية بالتكميم شرطاً أساسياً قبل نشر الوكالات ذات الوزن المفتوح. إن هذه الاكتشافات تفتح باباً جديداً لإعادة التفكير في طرق تقييم أمان النماذج، نظراً لتعقيد التهديدات المحتملة.
ما رأيكم في هذه التطورات الجديدة؟ شاركونا في التعليقات!
هجوم خلفي مشروط بالتكميم: اكتشاف ثغرات خطيرة في نماذج الذكاء الاصطناعي!
تمثل الهجمات الخلفية المشروطة بالتكميم تهديداً خطيراً لنماذج اللغة الضخمة (LLMs). دراسة جديدة تقدم إطار عمل AGENTQ لكشف هذه الثغرات وتتيح تحسين الأمن أثناء نشر النماذج المفتوحة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
