تتزايد التحديات المرتبطة بالسلامة في عالم الذكاء الاصطناعي، حيث تتطور استراتيجيات الاختراق بسرعة أكبر من قدرة النماذج على التأقلم. لذلك، تم طرح نظام **الأمان الذاتي القائم على التكيف** (Self-Guided Adaptive Safety Alignment - SGASA) كحل مبتكر لتسريع هذه العملية.
تم إجراء دراسة لاستكشاف ما إذا كان يمكن لنموذج التفكير أن يقوم بتوليف وإقرار إرشادات أمان محددة لمهام معينة، وذلك بناءً على مجموعة صغيرة من الأمثلة الضارة وغير الضارة. توصلت النتائج إلى أن النموذج يولد إرشادات خاصة به، ويقوم بتحسينها استناداً إلى أخطائه، ثم يقوم بتحديد أفضل الإصدار من خلال تقييم ذاتي.
في التجارب التي أُجريت باستخدام مجموعتي بيانات من التحديات العدائية وثلاثة مقاييس من Qwen3، أثبتت الإرشادات التي تم تحليلها في السياق تحسينًا في الأداء بمعدل يتراوح بين 20.0 و45.5 نقطة في سلاسل الأمان وعدم الرفض المفرط على نماذج 8B و14B. كما أظهرت عمليات التقييم الذاتي قدرتها على اختيار أفضل جولة تحسين خارجي في خمسة من أصل ستة إعدادات.
تظهر هذه النتائج قدرة النماذج على الاستفادة من الإرشادات الذاتية كنموذج مفيد للتكيف الأمني، مما يتماشى مع الموارد المحدودة. حتى عند الاعتماد على إشراف محاذي مشتق فقط من WildJailbreak، احتفظت النماذج الداخلية بمكاسب تتراوح بين 13.3 و14.1 نقطة دون الحاجة إلى إرشادات وقت الاستنتاج. هذه الانجازات تشير بشكل واضح إلى أن تطوير إرشادات أمان ذاتية يعد خطوة مهمة نحو تحقيق تحسين الأمان في نماذج التفكير الذكية.
ما رأيكم في التطبيقات العملية لهذه التكنولوجيا الجديدة؟ شاركونا آرائكم في التعليقات!
ابتكار نظام الأمان الذاتي: هل يمكن للنماذج الذكية تنظيمها بشكل أفضل؟
تقدم تقنية الأمان الذاتي القائم على التكيف (SGASA) أساليب جديدة لتعزيز سلامة نماذج التفكير. تعكس هذه النتائج قدرة النماذج على تطوير إرشادات أمان من تلقاء نفسها، مما يزيد من كفاءتها في مواجهة تحديات السلامة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
