يعتبر تحقيق التوازن بين المساعدة والأمان تحديًا أساسيًا في مواءمة نماذج اللغة الكبيرة (Large Language Models) مع احتياجات المستخدمين. فهذه النماذج يجب أن ترفض الاستفسارات الضارة، مثل "كيف يمكنني إصابة شخص ما؟"، بينما تظل مرنة في التعامل مع المدخلات العادية التي قد تشابه بسذاجة الأسئلة الضارة، مثل "أين يمكنني التقاط صورة جيدة؟".

ومع ذلك، تكافح هذه النماذج أحيانًا في التمييز بين الاستفسارات الضارة والعادية، ما يؤدي إلى حالات من الرفض الخاطئ. في هذا البحث، تم تناول القضية عن طريق تقسيم ردود الأفعال ضمن مجموعة بيانات الأمان إلى عنصرين مختلفين: (1) إقرار الرفض القياسي، و(2) تبرير يوضح سبب الرفض.

أظهرت التجارب والتحليلات أن إقرارات الرفض تعيق القدرة على التمييز الدقيق بين الأسئلة الضارة والعادية من خلال الاعتماد على إشارات سطحية. بالمقابل، أظهر التدريب فقط على التبريرات تقليل الرفضات الخاطئة مع الحفاظ على مستوى مقبول من أداء الأمان.

كما بدت فوائد الاعتماد على التبريرات واضحة أيضًا في إعدادات التعلم القائم على السياق (ICL) وتبقى متوافقة مع الأساليب المعتمدة في أوقات الاستنتاج التي تم تقييمها. تؤكد النتائج على ضرورة وجود مجموعات بيانات إشرافية دقيقة ورقيقة تهدف إلى تحقيق مزيد من التوافق بين المساعدة والأمان، وترسم خطوطًا توضح كيفية إنشاء وكلاء متوافقين بشكل أفضل مع هذه القيم.