شهدت نماذج اللغة الكبيرة (Large Language Models) تطوراً كبيراً في السنوات الأخيرة، حيث أصبحت تُستخدم بشكل شائع في تطبيقات متنوعة. ومع ذلك، يثير اعتماد هذه النماذج على آليات الدفاع المحلية تساؤلات حول مدى فعاليتها في مواجهة الهجمات السيميائية. في هذا السياق، يتناول البحث الجديد مشكلات حقيقية تتعلق بالأمان في هذه النماذج.

لا تتضمن النماذج المحلية مثل Ollama وحدات مراقبة وتأمين مماثلة لتلك الموجودة في النماذج القائمة على الـ API، مما يعني أن أمانها يعتمد بشكل كبير على أساليب الدفاع المعتمدة. يقدم هذا البحث تدقيقاً شاملاً لآليات الدفاع المستخدمة في مواجهة هجمات الاختراق، حيث يتم تحليل كل آلية على حدة.

وقد صنف الباحثون الدفاعات إلى نوعين: الدفاعات التي تقدم ضمانات رسمية مثل (SmoothLLM)، و(Erase-and-Check)، و(Sequential Monitors)، والدفاعات التي تعتمد على نتائج الكشف التجريبية مثل (Semantic Smoothing)، و(Self-Denoised Smoothing)، و(Perplexity Filtering).

بدلاً من الاكتفاء بملاحظة فشل بعض الدفاعات، تتبع الدراسة كل فشل إلى الافتراضات المحددة التي يُعتمد عليها، حيث تستخرج الشروط المرتبطة بكل آلية وتختبر التنبؤات الناتجة عن انتهاك تلك الافتراضات باستخدام ستة نماذج مفتوحة الوزن تتراوح بين 14 إلى 35 مليار معلمة. وقد تم استخدام مجموعة مكونة من 100 استفسار من مصادر عامة متعددة، تم تقييمها بمجموع 13,800 سجل.

يساعدنا هذا البحث في فهم عميق لآليات الأمان في النماذج اللغوية، ويكشف عن نظام معقد من الافتراضات الذي يعيد تشكيل كيفية تصميم هذه الدفاعات.