في عالم الذكاء الاصطناعي، حققت نماذج اللغة الكبيرة (Large Language Models) إنجازات مدهشة في العديد من المجالات، ولكن لا تزال آليات الأمان لديها معرضة للتهديدات، مثل هجمات jailbreak. لقد تم التعرف على مشكلة جديدة تشير إلى تأخر توسيع الأمان - safety generalization lag - حيث تتعذر نماذج اللغة المدربة على النصوص الطبيعية من التكيف مع البرمجة.
يكشف البحث الجديد، الذي يحمل عنوان "CodeMimicry"، عن طريقة مبتكرة لاستغلال هذه الثغرة. من خلال اقتراح إطار عمل أوتوماتيكي بالكامل لهجوم jailbreak، يمكن لقائمته من البرمجيات أن تُنتج أوامر برمجية منظمة تسمح بإنشاء مخرجات ضارة عبر إكمال الكود. أظهرت التجارب مع 8 نماذج تجارية متطورة أن CodeMimicry حقق معدل نجاح قدره 96.25% مع متوسط 1.51 استعلام، متفوقًا بشكل كبير على الأساليب السابقة المبتنية على القوالب أوOptimization.
عبر تحليل ميكانيكي للهجمات القائمة على البرمجة، يستعرض البحث أهمية وجود آليات أمان قوية وموثوقة في مجالات الكود، ويرسم معالم التحديات المستقبلية التي قد تواجه التطور السريع في هذه التكنولوجيا. ماذا يعني ذلك لمستقبل الأمان في الذكاء الاصطناعي؟ يتطلب الوضع الحالي التركيز على طرق جديدة لتعزيز الأمان.
هل تعتقد أن هذه الثغرات ستؤثر على اعتماد الذكاء الاصطناعي في الأنظمة الحساسة؟ شاركونا بآرائكم في التعليقات!
كشف ثغرة جديدة: CodeMimicry يتحدى آليات الأمان في نماذج اللغة الكبيرة!
تقدم دراسة جديدة إطار عمل Automation خاص بهجوم jailbreak يسمى CodeMimicry، يكشف عن ضعف في آليات أمان نماذج اللغة الكبيرة. بفضل فعاليته العالية، يسعى هذا الابتكار إلى مواجهة التحديات الجديدة في مجال أمان الذكاء الاصطناعي.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
