في عالم الذكاء الاصطناعي، أصبحت نماذج اللغات الضخمة (Large Language Models - LLMs) أكثر انتشارًا في التطبيقات التي تتطلب دقة عالية، ومع ذلك، لا تزال تواجه تحديات كبيرة في توليد محتوى قد يكون سامًا، ضارًا أو ينتهك السياسة. لتجاوز هذه المخاطر، طُرحت طرق مبتكرة لتحليل سلوك هذه النماذج.

قدمت دراسة جديدة إطارًا يستخدم الأنظمة الديناميكية للكشف عن أمان نماذج اللغات الضخمة. يهدف هذا الإطار إلى تعزيز فعالية الكشف عن المحتوى غير الآمن من خلال تحليل ديناميكيات التفاعلات بين المدخلات والمخرجات. يتم ذلك من خلال إسقاط كل من المدخلات (prompts) والمخرجات (responses) في فضاءات تداخل ذات أبعاد مرتفعة، مما يسمح بالمزيد من التحليل الدقيق.

تقوم الدراسة بتطوير نماذج قائمة على Koopman لتوقع النتائج بناءً على أنماط مختلفة من المدخلات. مما يميز هذه الطريقة هو كيفية استخدام ديناميكيات تضمين المدخلات والمخرجات، حيث تساعد هذه الديناميكيات في استنتاج أنماط التفاعل المهمة.

أظهرت نتائج الاختبارات أن إدراج ديناميكيات المدخلات يحسن بشكل ملحوظ القدرة على الكشف، خاصة في حالات الانتهاكات المعتمدة على التفاعل. كما أظهرت النتائج تفوقًا في طريقة العوامل السيمانتية الكثيفة (dense semantic embedding) في الحالات التي تتطلب تصنيف المخرجات فقط. من المحتمل أن يمثل هذا العمل خطوة رائدة نحو استخدام الأنظمة الديناميكية لتحليل أنظمة الذكاء الاصطناعي بدلًا من الأسلوب السائد الذي يعتمد على نمذجة الأنظمة الديناميكية بواسطة الذكاء الاصطناعي.

هذه التطورات تحمل في طياتها إمكانية تغيير الطريقة التي نتفاعل بها مع المحتوى الإنشائي وتفتح أبوابًا جديدة لفهم أمان الأنظمة الذكية.