في عالم الذكاء الاصطناعي المتزايد التعقيد، يعتبر الأمان في نماذج اللغة الكبيرة (Large Language Models) مسألة حيوية. توصل الباحثون إلى تقنية جديدة تُعرف باسم TRACE (Trajectory Return Attribution and Contrastive Erasure)، التي تهدف إلى تعزيز أمان هذه النماذج خلال التفاعلات المتعددة الجولات.
تقليديًا، تعاني نماذج اللغة الكبيرة من عدم القدرة على التحكم في المخاطر عندما يتم توزيع الهدف الضار عبر عدة استجابات. بينما كانت نماذج الاعتماد على الأهداف أحادية الاستجابة تُصنف الاستجابة الكاملة لجميع الطلبات، إلا أن ذلك لم يُحسّن من الأمان بشكل كافٍ. هنا يأتي دور TRACE، التي تقدم آلية جديدة للتعامل مع هذه التحديات.
تقوم تقنية TRACE بتحويل مبدأ ضبط المخاطر إلى هدف مستقل لكل رمز. حيث يتم وزن كل رمز استجابة من خلال العائد المخصوم للمزايا القابلة للرفض، مما يعني أنه يتم إعطاء وزن أكبر للاستجابات التي ترفض الطلبات الضارة. تعتمد هذه التقنية أيضًا على مقارنة النموذج المرجعي الثابت بنسخة تم تعديلها بإلغاء بعض العناصر، مما يسمح للإجابات السابقة بالحصول على رصيد من الأدلة الرفض في الاستجابات اللاحقة.
الأرقام تتحدث لنفسها؛ عبر خمس نماذج مفتوحة الوزن وسبعة هجمات على مدى عدة جولات، حققت TRACE أقل معدل نجاح للهجمات (Attack Success Rate) في جميع 35 مجموعة من النماذج والهجمات. رغم ذلك، فإن فعالية النموذج المقياس على مقياس MMLU وHellaSwag لم تتأثر إلا بحد أقصى قدره 1.23 نقطة.
تدريجيًا، تُظهر TRACE كيف يمكن للابتكارات في التصميم أن تؤدي إلى نماذج أكثر أمانًا وموثوقية. في الوقت الذي نتطلع فيه إلى مستقبل الذكاء الاصطناعي، يُعد هذا التطور خطوة هامة نحو تأمين التفاعلات البشرية مع هذه الأنظمة.
في الختام، هل تعتقد أن تقنية TRACE ستشكل تحولًا حقيقيًا في مجال أمان الذكاء الاصطناعي؟ شاركونا آراءكم في التعليقات!
TRACE: التحسين الثوري لنماذج اللغة الكبيرة من أجل الأمان متعدد الجولات!
تقدم تقنية TRACE (Trajectory Return Attribution and Contrastive Erasure) حلاً ثورياً لمشكلة الأمان في نماذج اللغة الكبيرة (LLMs) عبر تنسيق جديد للأهداف المعتمدة على النقاط. تلك التقنية تحقق أقل معدلات نجاح للهجمات المتعددة الجولات مع الحفاظ على فعالية النموذج.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
