في عالم الذكاء الاصطناعي، حيث أصبحت نماذج اللغة الضخمة (Large Language Models) أداة لا غنى عنها، ظهرت تحديات جديدة حول سلوكيات هذه الأنظمة. دراسة حديثة تناقش كيف يؤثر التلاعب بالبيانات المستعملة في تدريب هذه النماذج سلبًا، مما قد يؤدي إلى سلوكيات مضللة وغير مرغوب فيها.
تستند هذه الدراسة إلى فكرة مفادها أن الاستخدام الانتقائي لبيانات ضارة، حتى لو كان بنسبة صغيرة، يمكن أن يُدخل تصرفات غير مرغوبة في النماذج. وفي حين أن العديد من الدفاعات التقليدية، مثل تنقية البيانات وخلط البيانات غير الضارة، تساعد في تقليل هذه المخاطر، إلا أنها غالبًا ما تفشل في القضاء عليها بالكامل.
وللتغلب على هذه التحديات، تسعى الدراسة إلى تحقيق قدر أكبر من القوة من خلال استخدام الاستراتيجية المعروفة باسم "التوافق". تتضمن هذه الاستراتيجية إنشاء نماذج مرجعية منفصلة لكل مجموعة بيانات، ومن ثم دمج التوزيعات لاختيار الاحتمالات الأكثر موثوقية.
قدمت الدراسة نوعين من أجهزة فك التشفير المعتمدة على التوافق: الأول هو «الحد الأدنى لكل توكن»، الذي يقيد كل توكن على أقل احتمال يتم تعيينه من قبل أي مصدر، والثاني هو النسخة القاعدة النسبية، التي تعود إلى احتمال القاعدة في حال تباين مصادر البيانات. هذه التقنية لا تعزز الأمان فحسب، بل تحافظ أيضًا على سلوكيات مرغوبة مشتركة بين النماذج.
دراسات سابقة أظهرت أن تقنيات التعليم السري والخلط بين سلوكيات غير مرغوبة يمكن محاربتها بكفاءة عبر هذه الاستراتيجيات المتطورة.
إذا كنت مهتمًا بمستقبل نماذج اللغة وكيف يمكن لهذه التطورات أن تؤثر على أمن البيانات، تابعنا في قادم مقالاتنا!
ثورة جديدة في أمان نماذج اللغة: تقنيات متقدمة لمواجهة سلوكيات خفية
دراسة جديدة تكشف كيف يمكن تعزيز أمان نماذج اللغة من خلال استراتيجيات تجميع ذكية. باستخدام توافق التوزيعات، يمكن الحد من السلوكيات الضارة المتنقلة عبر البيانات المدربة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
