في عالم الذكاء الاصطناعي، تمثل نماذج اللغات الضخمة (Large Language Models) تقدمًا غير مسبوق، لكن هذا التقدم لا يخلو من التحديات. سُجلت حالات تعتبر فيها هذه النماذج عرضة لهجمات خلفية (Backdoor Attacks) تسمح للمهاجمين بتنفيذ أوامر معينة من خلال تحركات خفية. بينما تتعدد طرق الدفاع، إلا أن فريقًا من الباحثين قد قدموا استراتيجية جديدة تُسمى "إغلاق الخبراء المحجوزين" (Quarantined Expert Shutdown - QES) تهدف إلى تحسين الأمان دون التأثير الكبير على الأداء.
تتوزع استراتيجيات الدفاع الحالية إلى أربع مراحل: التدريب المسبق، والتدريب، وبعد التدريب، ووقت الاستدلال. لكن الاستراتيجية الجديدة التي تم اقتراحها تسمح بتكوين الهجمات الخلفية أثناء التدريب، لكنها توجّه هذه السلوكيات إلى جزء خاص يتم حجبه في وقت التنفيذ، بحيث يمكن تعطيله عند الحاجة. تعتمد هذه الاستراتيجية على نموذج مدعوم بتقنيات تنظيمية فريدة وموجهات خفيفة.
ومع وجود مجموعة بيانات مصابة، يضيف QES فروعًا خاصة بكل خبير إلى نموذج يعتمد على بنية المحولات (Transformers)، ويستخدم أهداف توجيه ملحقة لجذب السلوك المرتبط بالمؤشرات المستهدفة إلى الخبير المعين مع الحفاظ على الأداء العادي للنموذج. بعد ذلك، يمكن تقليص عملية التخفيف إلى إجراء واحد يتطلب ضبط وزن التوجيه الخاص بالخبير المحجوز، مما يعني عدم الحاجة لاستبعاد المؤشرات أو تحديث أوزان النموذج.
تظهر النتائج أن هذه الطريقة قلصت معدل نجاح الهجمات من 100% إلى نسبة تتراوح بين 0-10% عبر عدة مهام وهجمات وأربعة عائلات من النماذج. هذا الابتكار يُظهر إمكانية استكشاف نظم جديدة لمواجهة التهديدات في نماذج اللغة التوليدية، مما يفتح آفاقًا جديدة للحماية في عالم الذكاء الاصطناعي.
استراتيجيات جديدة لحماية نماذج اللغات الضخمة من الهجمات الخلفية!
ابتكر الباحثون استراتيجية قرن إضافية لمكافحة الهجمات الخلفية في نماذج اللغات الضخمة. توضح هذه الطريقة الجديدة كيفية توجيه المخرجات الضارة إلى جزء محدد يمكن تعطيله عند الحاجة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
