في عالم الذكاء الاصطناعي المتطور، تبرز النماذج اللغوية المدربة مسبقاً (Pretrained Large Language Models) كأحد الأعمدة الأساسية لتطوير التطبيقات الذكية. ومع ذلك، تظل الآثار الأمنية المرتبطة بهذه النماذج غير واضحة. ينشأ تساؤل هام: هل تكتسب النماذج المخصصة (Finetuned LLMs) نقاط الضعف من النماذج المدربة مسبقاً بها؟
للإجابة على هذا السؤال، أجرى الباحثون دراسة تجريبية ضمن نموذج تهديد واقعي، حيث يتوفر للمهاجم الوصول الكامل إلى نموذج اللغة المدرب مسبقاً ولكن لا يمكنه الوصول إلى نسخها المخصصة. وقد أظهرت النتائج أن استراتيجيات الهجوم المدروسة والتي تم تحسينها على النموذج المدرب مسبقاً تنتقل بشكل فعّال إلى النسخ المخصصة.
واحدة من النتائج الشيقة هي أن ضعف النقاط الانتقالية موجودة في المستوى التمثيلي للنموذج، مما يوحي بأن الهيكل ذو الصلة بالتحويل موجود بالفعل في التمثيلات المدربة مسبقاً. بالاستفادة من هذه الرؤية، قدم فريق البحث نموذج هجوم جديد يُدعى "هجوم التوجيه المدعوم بالاستكشاف" (Probe-Guided Projection - PGP) الذي يوجه عملية التحسين نحو الاتجاهات ذات الصلة بالتحويل.
تدعم التجارب عبر العديد من عائلات نماذج اللغة والمهام المتنوعة نجاح PGP القوي في الانتقال، مما يبرز المخاطر الأمنية المتعلقة بنموذج الانتقال من التدريب إلى التخصيص. وأخيراً، تبين أن نفس الرؤى التمثيلية يمكن أن تساهم في توفير دفاعات خفيفة الوزن تقلل من انتقال نقاط الضعف بين النماذج المدربة مسبقاً والمخصصة، دون التأثير على الفائدة من التطبيقات اللاحقة.
ما رأيكم في هذه النتائج المثيرة؟ هل يجب أن نكون أكثر حذراً عند استخدام النماذج المدربة مسبقاً في تطبيقات الذكاء الاصطناعي؟ شاركونا آرائكم!
تسريبات مقلقة: كيف تعزز نماذج اللغة المدربة مسبقاً مخاطر الاختراقات عند تخصيصها!
تكشف دراسة حديثة عن المخاطر الأمنية المرتبطة بنماذج اللغة المدربة مسبقاً، حيث تُظهر أن هذه النماذج تنتقل بها نقاط الضعف إلى النسخ المخصصة. هذه النتائج تبين ضرورة اتخاذ تدابير وقائية لحماية التطبيقات المعتمدة على الذكاء الاصطناعي.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
