في عالم الذكاء الاصطناعي، تتزايد الحاجة إلى نماذج لغوية ضخمة (Large Language Models) آمنة وفعالة تلبي احتياجات المستخدمين دون التقليل من أدائها. وهنا يظهر الإطار الجديد TRACE، الذي يمثل ثورة في كيفية تعزيز سلامة هذه النماذج بعد التدريب.
تسمح منصات Fine-Tuning-as-a-Service (FTaaS) للمستخدمين بتدريب نماذج اللغة على مهام مخصصة، ولكن هذا قد يؤدي إلى تآكل التوافق مع معايير السلامة. على رغم أن بعض الدراسات تعتمد على دمج معلمات النموذج لإضافة تصحيحات سلامة، إلا أن هذه الطريقة تواجه مشاكل كبيرة بسبب تعقيد التفاعل بين تحديث السلامة والمهام. فعندما يتم قياس قوة الدمج بشكل غير دقيق، يمكن أن تمنع المكونات الضارة النموذج من العودة إلى وضع آمن.
يقدم TRACE حلاً مبتكرًا من خلال تحويل التركيز من تصميم عمليات دمج عبر الإنترنت إلى التعلم عن بعد لتصحيحات السلامة. حيث يقوم بإعادة تعيين سلامة النموذج عن طريق تقنيات محاكاة للعمليات الضارة وتحسين التصحيح الفرعي. في تجربة شاملة شملت ستة معايير ونموذجين، أظهر TRACE تميزًا في واجهة السلامة والكفاءة؛ محققًا سلامة شبه كاملة تقارب 100% دون التأثير على قدرة النموذج على الأداء.
بهذا، تسجل TRACE نقطة تحول في كيفية حماية نماذج الذكاء الاصطناعي، مما يفتح آفاقًا جديدة لمستقبل ذكي وآمن.
TRACE: ثورة جديدة في تعزيز سلامة نماذج اللغات الضخمة بعد التدريب!
تقدم TRACE إطارًا مبتكرًا لتعزيز سلامة نماذج اللغات الضخمة (LLMs) بعد تدريبها، دون التأثير على أدائها. هذا الابتكار يعد قفزة نوعية في عالم الذكاء الاصطناعي.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
