في عالم الذكاء الاصطناعي (AI)، باتت نماذج اللغات المفتوحة ذات الأوزان (Open-weight Language Models) تمثل أسلوباً متنامياً، ولكنها تواجه تحديات كبيرة تتعلق بالأمان. من أبرز هذه التحديات هو فعالية آليات الكشف عن الاستخدام الضار، والتي يُطلق عليها "آليات العلامات المُحفزة" (Trigger-Tag Mechanisms).
تعتبر آليات العلامات المُحفزة وسيلة جديدة تُستخدم لإنتاج إشارات قابلة للكشف عندما يتم استخدام النموذج في ظروف معينة، مثل إنشاء محتوى احتيالي. إلا أن الأبحاث الحالية أشارت إلى أن هذه الآليات تحتاج إلى مزيد من الدراسة لضمان قدرتها على التصدي للهجمات المعادية.
في هذا السياق، قام الباحثون بتصنيف آليات العلامات المُحفزة إلى نوعين رئيسيين: آليات العلامات المُحفزة على مستوى الرموز (Token-level Trigger-Tags) و آليات العلامات المُحفزة على مستوى الأوزان (Weight-level Trigger-Tags). الأولى تعمل على إدخال إشارات مستوحاة من العلامات المائية خلال عملية التفكيك، بينما الثانية تخلق ارتباطات مستوحاة من الآثار الخلفية بين الظروف المستهدفة وسلوك النموذج القابل للكشف.
مؤخراً، تم تقديم إطار هجوم موحد يُعرف باسم "Untag"، والذي ينظم أسطح الهجوم الخاصة بكل آلية ضمن تصنيف موحد. من خلال دراسة حالة استخدام محتوى احتيالي، ظهرت نتائج تكشف عن أن آليات العلامات المُحفزة قد تقدم أدلة مفيدة في بيئات مسيطر عليها، إلا أن الهجمات النظيرة تجعلها غير فعالة تماماً في الظروف الواقعية. لذا، يُنصح بعدم اعتبار هذه الآليات ككشف موثوق لاستخدامات ضارة عندما يستطيع المهاجمون تغيير المخرجات أو تعديل الأوزان المفتوحة للنموذج.
إذاً، كيف يمكن أن نضبط حماية نماذج اللغات المفتوحة أمام أساليب الهجوم الجديدة؟ شاركونا آراءكم في التعليقات.
تحذير: ضعف آلية الكشف عن الاستخدام الضار في نماذج اللغات المفتوحة
تكشف الأبحاث الجديدة عن هشاشة آليات الكشف عن الاستخدام الضار في نماذج اللغات ذات الأوزان المفتوحة، مما يهدد فاعلية الحماية المعتمدة مركزياً. الدراسة تستعرض كيف يمكن لمهاجمين تجاوز هذه الحماية بسهولة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
