في عالم الذكاء الاصطناعي، يتزايد الحديث عن مسألة الأمان وموثوقية النماذج الكبيرة. دراسة حديثة تسلط الضوء على كيف يمكن أن تكون هذه النماذج، مثل النماذج متعددة الخبراء (Mixture-of-Experts) التي تحتوي على 320 مليار معلمة، عرضة لهجمات محددة. وقد تم استخدام أسلوب يسمى "الإزالة الاتجاهية" الذي يعمل على الحفاظ على نموذج لغوي متوازن من خلال تجاهل القدرة على الرفض، مما يكشف عن نقاط ضعف في أمان هذه النماذج.

على الرغم من أن هذا الهجوم تم اختباره على نماذج كثيفة حتى 70 مليار معلمة، إلا أن هذه الدراسة تهدف إلى تقييمه في النماذج الجديدة ذات بنية أكثر تعقيداً. النتائج أظهرت أن الهجوم لا يزال فعالاً، ولكن التأثيرات التي يمكن الوصول إليها ليست كما توقعها الباحثون سابقاً، مما يثير تساؤلات مهمة حول كيفية تعديل النماذج لمحاربة هذا السلوك غير المرغوب.

عبر استخدام بيانات تفصيلية من سبعة معايير ضارة، كشفت الدراسة عن تقليصات كبيرة في قدرة الرفض، حيث حققت القيم انخفاضات تصل إلى 89 نقطة مئوية. ولكن الأهم من ذلك، هو أن هذه الانخفاضات لم تسبب أي تغييرات ملحوظة في قدرة النموذج.

إن فهمنا لطرق الانهيار في النماذج الكبيرة يفتح آفاقاً جديدة في مجال الأمان، ويجب أن تكون هذه النتائج بمثابة دعوة للتفكير العميق في كيفية التعامل مع مثل هذه التقنيات في المستقبل. ما هي الخطوات التي يجب اتخاذها لضمان أمان الذكاء الاصطناعي؟ هذا سؤال يتطلب التفكير الجماعي والتحليل العميق.