تسعى نماذج اللغة الكبيرة (Large Language Models - LLMs) باستمرار لتقديم أداء متميز، لكنها تظل عرضة للهجمات التي تستهدف إنتاج محتوى ضار أو غير آمن. ورغم الجهود المبذولة في تقنيات التوافق مع الأمان، مثل التعديل الخاضع للإشراف (Supervised Fine-Tuning - SFT) وتعلم التعزيز من التغذية الراجعة البشرية (Reinforcement Learning from Human Feedback - RLHF)، فإن هذه الطرق تتطلب الكثير من الإشراف والتكاليف الحسابية، وغالبًا ما تكون عرضة لمشاكل مرتبطة بالإفراط في الرفض.

لذلك، نقدم لكم إطار SSRFT، وهو النظام الأول الذي يعيد صياغة توافق الأمان على أنه داخلي لدور آمن مسبق التحديد. حيث يقوم SSRFT بإنشاء مجموعة بيانات لأسئلة وأجوبة تتعلق بالدور الآمن (Safe-Role Question-Answer - SRQA) اعتمادًا على أسئلة نفسية، ونماذج محدودة من الهجمات، ووصف للدور الآمن.

تتم معالجة الاستجابات بشكل يتماشى مع الدور، ويتم التحقق منها وتوسيعها لتشمل سيناريوهات متنوعة، مما يمكّن النماذج من استيعاب القيم والمبادئ المرتبطة بالأمان بدلاً من أنماط الرفض الصريحة.

أظهرت التجارب على نماذج أساسية ورقمية أن SSRFT يتحقق من توافق أمان أكثر قوة وقابلية للتعميم مقارنةً بـ SFT التقليدي. كما أثبت SSRFT قوته في مواجهة الهجمات المسبقة وقدرته على التعميم في مجالات الهجمات غير المرئية، مع تقليل الإفراط في الرفض على الاستفسارات غير الضارة مع الحفاظ على قدرات النموذج العامة.

تُعتبر نتائج هذا البحث دليلاً قويًا على فعالية الداخل للدور الآمن كبديل للتوافق المرتكز حول الرفض. يُشَارُ إلى أن البحث يحتوي على أمثلة للغة ضارة وسامة، مما يسلط الضوء على أهمية تطوير نماذج قادرة على تقديم استجابات آمنة ومرنة.