في عالم الذكاء الاصطناعي، تبرز النماذج اللغوية الضخمة (Large Language Models) كأحد أبرز التطورات التقنية. لكن ماذا يحدث عندما تُستخدم هذه النماذج في أغراض ضارة؟
طور باحثون تقنية تُعرف باسم اختراق الاندماج الكامن (Latent Fusion Jailbreak) التي تُظهر إمكانية التلاعب بالنماذج اللغوية بطرق غير تقليدية. هذه التقنية تعتمد على دمج استفسارات سلبية مع أخرى إيجابية، لتغيير الصورة الداخلية للنموذج وتحفيز استجابات غير آمنة.
تعمل التقنية عن طريق تطابق استفسار ضار مع استفسار آخر مشابه له ولكنه غير ضار، ومن ثم يتم تعديل الحالات الخفية (hidden states) في طبقات معينة باستخدام خوارزميات متقدمة.
خلال التجارب التي تم إجراؤها على أربعة مقاييس أمان مختلفة وخمسة نماذج مستهدفة، كشفت النتائج عن نجاح الهجوم بنسبة مذهلة تصل إلى 94.13%. يحمل هذا الاكتشاف تبعات كبيرة لمستقبل نماذج الذكاء الاصطناعي، مما يثير تساؤلات حول الأمان والكفاءة.
ومع ذلك، كانت هناك بعض الاستثناءات؛ حيث يُظهر استخدام طرق معينة، مثل نقص عينة الرفض، تراجعًا بنسبة 86.72% في نجاح الهجمات، ما يثير القلق حول كيفية حماية النماذج من هذه الأنواع من التلاعب.
بهذه الطريقة، تمثل تقنية اختراق الاندماج الكامن تحديًا كبيرًا للباحثين في مجال الذكاء الاصطناعي، وتؤكد على الحاجة إلى أساليب دفاعية جديدة، بما في ذلك تدريب آلي لمواجهة هذه الهجمات.
اختراق الاندماج الكامن: كيف يمكن للنماذج اللغوية الضخمة أن تتعرض للتلاعب؟
تمكن باحثون من تطوير تقنية جديدة تُعرف باختراق الاندماج الكامن (Latent Fusion Jailbreak) التي تسمح بالتلاعب بالنماذج اللغوية الضخمة من خلال دمج استفسارات ضارة مع نظيراتها الحميدة. وقد أظهرت النتائج معدل نجاح هجوم يصل إلى 94.13%.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
