في عالم الذكاء الاصطناعي المتطور، تبرز النماذج اللغوية المدربة مسبقاً (Pretrained Large Language Models) كأحد الأعمدة الأساسية لتطوير التطبيقات الذكية. ومع ذلك، تظل الآثار الأمنية المرتبطة بهذه النماذج غير واضحة. ينشأ تساؤل هام: هل تكتسب النماذج المخصصة (Finetuned LLMs) نقاط الضعف من النماذج المدربة مسبقاً بها؟

للإجابة على هذا السؤال، أجرى الباحثون دراسة تجريبية ضمن نموذج تهديد واقعي، حيث يتوفر للمهاجم الوصول الكامل إلى نموذج اللغة المدرب مسبقاً ولكن لا يمكنه الوصول إلى نسخها المخصصة. وقد أظهرت النتائج أن استراتيجيات الهجوم المدروسة والتي تم تحسينها على النموذج المدرب مسبقاً تنتقل بشكل فعّال إلى النسخ المخصصة.

واحدة من النتائج الشيقة هي أن ضعف النقاط الانتقالية موجودة في المستوى التمثيلي للنموذج، مما يوحي بأن الهيكل ذو الصلة بالتحويل موجود بالفعل في التمثيلات المدربة مسبقاً. بالاستفادة من هذه الرؤية، قدم فريق البحث نموذج هجوم جديد يُدعى "هجوم التوجيه المدعوم بالاستكشاف" (Probe-Guided Projection - PGP) الذي يوجه عملية التحسين نحو الاتجاهات ذات الصلة بالتحويل.

تدعم التجارب عبر العديد من عائلات نماذج اللغة والمهام المتنوعة نجاح PGP القوي في الانتقال، مما يبرز المخاطر الأمنية المتعلقة بنموذج الانتقال من التدريب إلى التخصيص. وأخيراً، تبين أن نفس الرؤى التمثيلية يمكن أن تساهم في توفير دفاعات خفيفة الوزن تقلل من انتقال نقاط الضعف بين النماذج المدربة مسبقاً والمخصصة، دون التأثير على الفائدة من التطبيقات اللاحقة.

ما رأيكم في هذه النتائج المثيرة؟ هل يجب أن نكون أكثر حذراً عند استخدام النماذج المدربة مسبقاً في تطبيقات الذكاء الاصطناعي؟ شاركونا آرائكم!