في عالم الذكاء الاصطناعي، تُعتبر نماذج اللغة الضخمة (Large Language Models) أحد أبرز التطورات، إذ يُعتبر أمانها في التصدي للطلبات الضارة تحدياً مستمراً. وقد تم تقديم طريقة جديدة تدعى "هجوم ASCII" (ASCII Attack) التي تعيد صياغة الطلبات الضارة بطريقة فنية، مما يتيح لهذه النماذج فرصة الفشل في الامتثال لقواعد الأمان.
تعتمد طريقة "هجوم ASCII" على إدراج الطلبات الضارة ضمن رموز فنية، مما يجعلها تبدو كعمل فني، وعلى الرغم من أن الطلبات لا تزال قابلة للقراءة، إلا أنها تحفظ أمان النموذج. في دراسة جديدة، تم اختبار هذه الظاهرة عبر 11 نموذجًا وأكثر من 8 موضوعات للضرر، ووجد أن أدوات تصنيف الضار سجّلت 62% من الطلبات المعاد صياغتها كضارة مقارنة بـ 42% من الطلبات الضابطة.
على وجه الخصوص، تم تحديد نموذج واحد يظهر درجة تأثر تصل إلى 93% عند استخدام هذه الطريقة، مما يعني أنها فعالة للغاية. مع استمرار البحث في هذا المجال، يبقى التساؤل: هل يمكن اعتبار الفن وسيلة لتجاوز الحدود المفروضة من قبل التكنولوجيا؟ ما هي التأثيرات الأخلاقية المترتبة على ذلك؟
يُظهر هذا البحث كيف يمكن لصياغة جديدة للأفكار الضارة أن تتجاوز بروتوكولات الأمان التقليدية، مما يستدعي ضرورة تطوير أساليب أكثر قوة للتأكد من سلامة النماذج الذكية. ما رأيكم في هذا التطور؟ شاركونا في التعليقات!
هل يمكن للفن أن يكون سلاحاً؟ إعادة تفسير الطلبات الضارة عبر نماذج لغوية ضخمة!
كشف بحث جديد عن طريقة مبتكرة للتلاعب بأمان نماذج اللغة باستخدام أسلوب فني، مما يسجل نسبة تأثر مذهلة في إصدارات معينة. يتناول هذا الابتكار تأثير الطلبات الضارة المعاد صياغتها على أداء النماذج الذكية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
