في عالم الذكاء الاصطناعي، حيث تُستخدم نماذج اللغات الضخمة (Large Language Models) لتحقيق تأثيرات عالية، يصبح من الضروري مثلاً مراقبة سلامة هذه العمليات أثناء التشغيل. هنا يأتي دور NEXUS (Neural EXecution Utility and Safety)، الذي يمثل تقدماً ملحوظاً في تطوير نظام مراقبة سلامة مُهيكل يمكنه اتخاذ قرارات مستندة إلى سياسات تدخل رسمية.

يعمل NEXUS من خلال اختيار واحدة من أربع خيارات عمل: السماح، الحظر، طلب التأكيد، أو طلب التعديل. وبهذا، يجمع الموضوع بين قواعد السلامة المحددة، وفحص المستوى الحججي، ودرجة مخاطر مصنفة باستخدام الانحدار اللوجستي.

على سبيل المثال، أظهر NEXUS أداءً ممتازاً على مؤشر تجريبي مكون من 128 حالة، حيث بلغ معدل F1 0.949 ودقة التدخل بأربعة أصناف 0.6406. وبذلك تفوق على طرق الاختيار التقليدية للانترڤين بالشكل فقط بفارق 27.3 نقطة مئوية! في السياقات الأخرى، مثل R-Judge، حقق NEXUS F1 بمعدل 0.861 مقارنة بـ0.849.

الأفضل من ذلك، أن NEXUS لا يضيف إلا نسبة 0.1% كحمل إضافي، حيث تصل زمن استجابة الوسيط إلى 0.205 مللي ثانية. كل هذه الميزات تجعله أداة لا غنى عنها لمن يسعون لضمان سلامة نماذج اللغات أثناء التعامل مع أدوات متعددة.

الكود والاختبارات الخاصة بـ NEXUS تم إصدارها بشكل عام، مما يتيح للباحثين والمطورين استخدامها وتحليل أدائها بشكل أكبر. بهذه الطريقة، يعزز NEXUS السلامة ويقلل من المخاطر المرتبطة باستخدام نماذج اللغات في تطبيقات ذات تأثير عالٍ!