في عالم الذكاء الاصطناعي، يعد تقييم سلامة النماذج أمرًا بالغ الأهمية، حيث يتمتع بتأثير كبير على كيفية تصنيف الردود. دراسة جديدة نُشرت في arXiv، توضح كيف يمكن أن تؤثر الأنظمة مثل Llama Guard أو GPT-4o على النتائج من خلال التركيز على الشكل بدلاً من المحتوى. هل يا ترى هذه الأنظمة حقاً تقوم بتقييم ما يحتويه الرد أم أنها تقيّم الطريقة التي يُقال بها؟

تبتكر الدراسة أنواعًا جديدة من "المغلفات الشكلية"، التي تضيف نصوصًا ثابتة قبل أو بعد الرد لإعادة صياغة الطريقة التي يُعرض بها المحتوى. من خلال الحفاظ على النص الأصلي كما هو، يتم اختبار قدرة قضاة السلامة على الحفاظ على نتائجهم، وأي تغيير في الحكم يعكس فشلًا في نظام التقييم وليس تغيرًا في المحتوى.

من خلال تنفيذ أكثر من 600 رد على اختبار JailbreakBench، أظهرت النتائج أن بعض القضاة كانوا عرضة لاختناقات بسيطة، مما يعزز فكرة أن الأنظمة بحاجة إلى تحسين كبير. على سبيل المثال، أدى استخدام مغلف الاستبعاد إلى تغيير 19.9% من أحكام GPT-4o-mini.

هذا ليس مجرد بحث أكاديمي، بل إن النتائج تعكس تحديات حقيقية في كيفية تعامل أنظمة الذكاء الاصطناعي مع القضايا المتعلقة بالسلامة. ما رأيكم في هذه النتائج المثيرة؟ هل لديكم أفكار حول كيفية تعزيز أداء تلك الأنظمة؟ شاركونا في التعليقات!