في عالم الذكاء الاصطناعي، تعتبر نماذج اللغة الكبيرة (Large Language Models) ونماذج الرؤية-اللغة (Vision-Language Models) أهدافاً جذابة للهجمات التي تهدف إلى استدراج أنظمة الذكاء الاصطناعي لتقديم استجابات غير مرغوب بها، والمعروفة باسم "الهجمات النصية" أو "حقن الأوامر". لا تزال هذه الهجمات تمثل تحدياً كبيراً لمطوري الأنظمة، حيث أن أدوات الحماية الحالية قد تعاني من قيود في تغطية التهديد أو تزيد من تكاليف الاستدلال عبر تحويلات المدخلات أو استفسارات متكررة إلى النموذج.

هنا يأتي دور SALLIE (Single-Pass Activation Lookup for Layerwise Input Evaluation)، كاشف متطور يقدم حلاً معقداً لكشف الهجمات على نماذج الذكاء الاصطناعي. يعتمد SALLIE على هيكلية واحدة للكشف عن الهجمات في كل من النصوص والصور، مما يجعله فعالاً دون الحاجة لتوليد استجابات، وهو ما يميزه عن الأساليب التقليدية.

تعمل SALLIE عبر تمرير واحد إلى الأمام ويستخدم نماذج غير مربوطة لكشف الهجمات. من خلال استخراج تمثيلات البيانات من الطبقات المختلفة، وبتطبيق استعلامات الكود القريب (k-nearest-neighbor probes)، يمكن SALLIE من حساب متوسط الدرجات عبر مجموعة من الطبقات دون تعديل النموذج أو اللجوء إلى استجابة توليدية.

أظهرت الاختبارات المبنية على مجموعة بيانات اختبار متنوعة أن الإصدار المُعير الخاص بـ SALLIE-Phi حقق دقة إجمالية (F1) بلغت 0.87، متفوقاً على KCD-RCS في جميع الأنظمة الأساسية قيد الدراسة. مما يؤكد على فعاليته في الأمان والموثوقية عند التعامل مع تهديدات متعددة.

تجدر الإشارة إلى أن SALLIE يقدم أيضاً تقارير حول المقايضات بين معدلات الإيجابيات الخاطئة (FPR) والسلبيات الخاطئة (FNR)، بالإضافة إلى مؤشرات الأداء.

في ظل التحديات المتزايدة في أمان الذكاء الاصطناعي، يفتح SALLIE آفاقاً جديدة في كيفية الحفاظ على كفاءة النماذج وأمانها. ما رأيكم في دور SALLIE في تعزيز أمان الذكاء الاصطناعي؟ شاركونا آراءكم في التعليقات.