في عصر يتزايد فيه اعتمادنا على نماذج الذكاء الاصطناعي، تظهر أهمية ضمان سلامة هذه الأنظمة. SIGMA، وهو نظام مبتكر جديد، يسعى لتمكين النماذج الذكية من تحسين سلامتها الذاتية. توفر نماذج اللغات الضخمة (Large Language Models) قدرة متطورة على تنفيذ المهام المعقدة وتحسين أدائها بناءً على أهداف يسهل التحقق منها، مثل البرمجة الرياضية. لكن السلامة تبقى تحديًا أصعب في التحقق منه، مما يزيد المخاطر عند تطور القدرات دون وجود ضمانات مناسبة للسلامة.

يقدم SIGMA طريقة جديدة تعتمد على إنشاء بيانات وتدريب يمكّن النماذج من تحسين توازن السلامة بشكل ذاتي. إذ يستغل النظام قدرات التفكير للنموذج لدعم reasoning السلامة الخاصة به. يبدأ SIGMA بعملية توليد المهام التي تستند إلى المواصفات الموضوعة، حيث يعمل النموذج كوكيل مصمم للمهام لينتج سيناريوهات متنوعة تتعلق بالتحديات الأخلاقية، وتحويلها إلى مهام تدريبية.

بعد ذلك، يقوم SIGMA بإجراء تدريب على السلامة من خلال تحديد الذات، مستخدمًا التعلم المعزز المبني على معايير تقييم تنطوي على النموذج نفسه كنموذج مكافأة. وقد أثبت SIGMA فعاليته الملحوظة، حيث تمكن من تقليل مستويات المخاطر التي تواجهها الوكالات الذكية بشكل ملحوظ بفضل تدريباته، متفوقًا بذلك على نماذج تقليدية مثل Deliberative Alignment وConstitutional AI.

في هذه التجربة، كانت المواصفات النموذجية التي تحافظ على التوازن بين خلو المخاطر وفائدة المساعدة، وإجراءات التفكير في السلامة، والمقاييس عالية الجودة من العوامل الحاسمة لتحقيق تحسن فعال في مستوى السلامة. إن التطور نحو تحسين السلامة الذاتية خطوة هامة نحو جعل الذكاء الاصطناعي أكثر احترامًا لأخلاقيات الاستخدام وضمان تحقيق الفوائد المرجوة منه.