في عالم الذكاء الاصطناعي، تعتبر نماذج اللغة الكبيرة (LLMs) أحد الابتكارات الرائدة، لكن ثغراتها الخلفية تمثل تحديًا كبيرًا يتطلب الانتباه. في دراسة حديثة، تم الكشف عن ديناميكيات تطهير الثغرات الخلفية في وكلاء نماذج اللغة، مما يكشف عن مدى تعرض هذه النماذج للاختراق أثناء عملية الضبط الدقيق.
تظهر الأبحاث أن وكلاء النماذج المفتوحة الوزن (Open-weight LLMs) قد يتعرضون لثغرات خلفية تُركب خلال عملية التحسين، مما قد يجعل اكتشافها أمرًا صعبًا إذا لم يتم تفعيل شروط المحفز أثناء الاختبار. ونتيجة لذلك، تكون خيارات مكافحة هذه الثغرات محدودة، خاصة إذا لم يكن المدافعون على علم بالتحفيزات الموجودة.
تضمنت الاستراتيجيات المقترحة استخدام أساليب تسمى “السموم الدفاعية” (defensive poisoning) لإدخال ثغرة خلفية معروفة، ومن ثم محاولة إلغاء التعلم منها. كان الهدف هو حذف الفرع الأصلي غير المعروف كأثر جانبي. ومع ذلك، فإن النتائج كانت غير مضمونة؛ فقد تستمر الثغرة الأصلية أو تُمحى أو تتغير.
ركزت الدراسة على استكشاف هذه الديناميكيات من خلال عرض منهجية فريدة تعتمد على تجربة 115 نموذجًا للوكلاء. وأظهرت النتائج أن السموم الدفاعية وحدها قادرة على محو حوالي 56% من الثغرات الأصلية. وعند العمل على تطهير النموذج، يُظهر ما يقرب من كل البقاء من تلك الثغرات نتائج مدهشة، مما يؤكد أن التعرف على المحفزات وتنفيذها الخبيث يتمتعان بفصل سلوكي.
المثير للاهتمام أن التجارب أظهرت أن الثغرات الخبيثة لا تدوم عندما يتم استخدام محفزات مختلفة من نفس النوع العام مثل الثغرة الدفاعية، متبوعة بعملية التطهير. وعندما تم تثبيت ما يصل إلى أربع ثغرات، زادت مقاومة النماذج، محققة نتيجة تقدر بحوالي 36% فقط من المحو. ومع ذلك، عند تطهير ثغرة معروفة واحدة، تم محو 52 من 60 ثغرة متعايشة (87%).
عند تحليل النماذج بعد عملية التطهير بواسطة أداة J-lens، أكد الباحثون أن العملية استعادة استجابات نماذج اللغة الطبيعية، لكن لم تختفِ آثار الوعي بالتحفيز الأصلي من الطبقات الوسيطة.
هذا البحث يمثل خطوة مهمة في فهم كيفية التعامل مع التحديات المرتبطة بالنماذج المعقدة وكيفية تطوير استراتيجيات أكثر فعالية لضمان سلامتها وقدرتها على أداء مهامها دون التعرض للاختراق.
كيف تؤثر الثغرات الخلفية على نماذج اللغة؟ تحليل ديناميكيات التطهير في وكلاء نماذج اللغة الكبيرة
تظهر الأبحاث قدرة نماذج اللغة الكبيرة (LLMs) على التعرض للثغرات الخلفية أثناء عملية التحسين. وقد تم تقديم استراتيجيات جديدة للتعامل مع هذه الثغرات وتطهير الأنظمة من تأثيراتها.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
