في عالم اليوم المعتمد على الذكاء الاصطناعي، تزداد الحاجة إلى ضمان سلامة النماذج اللغوية المفتوحة (Open-Weight Language Models) وقدرتها على التعامل مع المطالبات الضارة أو الحساسة. لكن، ماذا لو كانت هذه النماذج غير آمنة بطبيعتها؟

تشير دراسة جديدة نشرت على أرشيف الأبحاث (arXiv) إلى وجود ثغرات في النماذج اللغوية المفتوحة، حيث تم اختبار ستة من هذه النماذج باستخدام مجموعة بيانات تحمل اسم ‘JailbreakBench’. تكشف النتائج عن أن هذه النماذج يمكن أن تقدم ردود فعل مضرة أو غير آمنة عند تلقي مطالبات تست فحص قوتها.

تقنية جديدة تُعرف بـ 'Perturbed Embedding Vector' (PEV) تُعتبر فعالة وسهلة الاستخدام لاختراق هذه النماذج. بدلاً من استخدام العمليات الحسابية المعقدة على التدرجات (Gradients) أو تغيير الأوزان الداخلية للنموذج، تعتمد هذه التقنية على إضافة ضوضاء عشوائية (Gaussian Noise) إلى تمثيلات متجهات الإدخال (Embedding Vectors) للمطالبة. يكمن جمال هذه الطريقة في بساطتها، حيث تتطلب وقتًا وجهدًا أقل بكثير لتوليد ردود غير آمنة.

وفقًا للاختبارات، تصل تكلفة التنفيذ للحصول على أول اختراق ناجح إلى مستوى أقل بكثير مقارنةً بالأساليب السابقة. حيث يظهر أن أول اختراق لنموذج جديد عادةً ما يتم في أقل من دقيقة. وهذا يجعل تقنية PEV من بين أكثر الوسائل فعالية في كشف الثغرات الأمنية.

إن فهم سلوك النماذج اللغوية تحت التأثيرات الخارجية كضوضاء متجهات الإدخال لا يعكس فقط تهديدات أمنية، بل يكشف أيضًا عن فرص جديدة لدراسة الديناميكيات المعقدة لهذه النماذج. وبذلك، تُظهر الدراسة أن هناك حاجة ملحة لمواصلة البحث في سلامة الذكاء الاصطناعي وكيفية تجنّب الأخطار المرتبطة به.