تفتح الأبحاث الجديدة التي تم نشرها في arXiv أفقًا جديدًا في فهم كيفية مهاجمة نماذج اللغة الكبيرة (Large Language Models) من خلال ما يسمى 'الهجمات المُتحكم بها'. إنه أمر مثير حقًا، فهذه الهجمات تهدف إلى تجاوز كل آليات الأمان المضمنة في هذه النماذج، وتعتمد على تلاعب بر probabilities (احتمالات) الكلمات التالية أثناء عملية التوليد.
لسوء الحظ، معظم الأساليب التقليدية تتطلب الوصول إلى أوزان النموذج أو احتمالات رموز معينة، مما يجعلها غير فعالة في الواجهات التي تقدم فقط نصوصًا عشوائية. هنا يأتي دور البحث الجديد الذي يتناول إمكانية إعادة بناء احتمالات من المخرجات العشوائية، رغم أن هذه الطريقة تعاني من عدم الاتساق والنقص قبل الوصول إلى نتائج مفيدة.
من خلال ملاحظات تجريبية، اتضح أن التغيرات الكبيرة في التوزيعات أثناء عمليات 'التحايل' الناجحة تتركز في مجموعة صغيرة من المواضع. وهذا ما دفع الباحثين لتطوير إطار عمل يُدعى 'Method'، وهو يصمم ليكون قادرًا على تنفيذ التحايل من خلال واجهات نصية فقط تسمح بالتجريب المتكرر.
يجمع نظام 'Sample-Based Distribution Reconstruction' بين المخرجات التي تم تجربتها مع احتمال سابق لتوفير إشارة تحكم قابلة للاستخدام. بينما يعتمد 'Risk-Gated Residual Control' على استجابة سابقة لتحديد متى يجب إعادة بناء وتعديل التوزيع، مما يركز التكاليف على المواضع المختارة.
كما يقدم النظام طريقة 'Speculative Multi-Token Execution' التي تساعد في تقليل المكالمات المستهدفة عبر التحقق من مسودات النصوص التي لا تحتاج إلى تدخل.
عبر أربعة نقاط استهداف وثلاثة مقاييس، أثبت الإطار الجديد نجاحه بمتوسط درجات أعلى في معظم المقارنات مع الأساليب التقليدية، مما يشير إلى قوة 'Method' في تحدي الأمان باستخدام تقنيات ذكاء اصطناعي رائدة.
الهجمات الذكية على نماذج اللغة السوداء: كيفية التحايل على الأمان!
تظهر الأبحاث الجديدة إمكانيات التلاعب في نماذج اللغة الكبيرة (LLMs) باستخدام أساليب مبتكرة. ومن خلال هذا المقال، نتناول إطار العمل الجديد 'Method' الذي يتيح التلاعب بالنصوص المُعطاة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
