أصبحت النماذج اللغوية المفتوحة (Open-Weight Models) هدفاً لهجمات تهدف إلى إزالة آليات الأمان الخاصة بها، مما يتيح للمستخدمين الحصول على استجابات خطيرة وغير مرغوبة. في دراسة جديدة، أشار الباحثون إلى ضرورة حماية هذه النماذج بطريقة مبتكرة، حيث قدموا تقنية "الذهب المخادع" (Fool's Gold) كحل نهائي لمواجهة مثل هذه التهديدات.

تعتمد التقنية الجديدة على فكرة أن ما يمكن إزالته يمكن أيضاً خداعه. إذ تقوم تقنية "الذهب المخادع" بإيجاد طريقة لمعالجة طلبات التشغيل الخطرة عبر تقديم استجابات مضللة، مما يحافظ على أمان المستخدمين. وتقوم هذه التقنية بتدريب نموذج داخل محاكاة قابلة للتفريق تمثل الهجوم، مع الحفاظ على سلوك نظيف تماماً للنموذج الأصلي أثناء استجابته لهذه الطلبات.

تم اختبار هذه التقنية على سبع نماذج من خمس عائلات مختلفة، يتراوح عدد عناصرها بين 9 مليارات إلى 122 مليار، فقد ثبت أن النماذج تتفاعل بأمان، مع معدلات نجاح تتراوح بين 0.51 و0.90 في تقديم استجابات مضللة. بينما في حالة النموذج الأضعف فإن النتائج كانت أقل دقة.

تشير النتائج إلى أن المستخدمين قد لا يكون لديهم وسيلة دقيقة لتحديد الاستجابات الصحيحة من الخادعة، مما يبرز ضرورة تطوير مزيد من الأبحاث لمواجهة هذه التحديات المستمرة في نماذج الذكاء الاصطناعي. فهل ستكون هذه التقنية بداية جديدة في عالم الأمان الرقمي؟ شاركونا آراءكم في التعليقات!