في خطوة ثورية نحو تحسين السلامة في النماذج اللغوية الضخمة (Large Language Models)، تم نشر دراسة جديدة تحت عنوان 'تعلم القيود الموجهة هندسيًا'. تهدف هذه الدراسة إلى معالجة التحديات المرتبطة بتصنيف السلامة، من خلال استخدام تقنيات الاستبعاد اللوجستي والخصائص الهندسية.

يعتمد نظام 'السلامة كوجه متنوع' (Safety as Polytope) على تعلم قيود نصف فضائي في الفضاء الخفي لنماذج اللغة. ومع ذلك، كان يعتمد سابقًا على ضبط عدد القيود حسب الفئة، وهو ما كان يتطلب جهدًا كبيرًا. لكن، توصل الباحثون إلى أن استخدام تقنية الاستخراج العددي النادر (Sparse Autoencoder) يمكن أن يُبدِّل قواعد اللعبة.

من خلال هذه التقنية، تم تحقيق تحسين كبير، حيث أصبح العدد الأمثل للقيود هو K=2 لأغلب الفئات، مما أدى إلى دقة تتراوح بين 96% و99% على معايير تصنيف معينة مثل 'BeaverTails'. هذه النتائج تخفف من الحاجة إلى دقة عالية من خلال عمليات مسح مكثفة للقيود المختلفة، مما يُظهر أن الحدود الآمنة يمكن وصفها بطريقة منخفضة الأبعاد في فضاء الميزات للنموذج.

علاوة على ذلك، استخدمت الدراسة أسلوبًا يُعرف 'القيود المخروطية'، حيث يتكيف الفتحة القابلة للتعلم مع تركيز الكتل لكل فئة، مما أضاف بعدًا جديدًا في تدريب النماذج يساهم في استقرار النتائج.

إن هذا التقدم في فهم القيود الموجهة هندسيًا يقدم رؤية جديدة حول كيفية التعامل مع تصنيفات السلامة، مما يضمن مستقبلًا أكثر أمانًا وموثوقية للنماذج اللغوية.