في سعيهم لتحسين نماذج الأساس الرسومية (Graph Foundation Models)، قام الباحثون بدراسة كيفية تأثير "طبقة المحاذاة" (alignment layer) على أداء هذه النماذج. لكن ما وجدوه كان مذهلاً! فقد اكتشفوا أن هذه الطبقة تشكل نقطة هجوم يمكن استغلالها، مما يُمكّن المهاجمين من التأثير على النماذج أثناء الاستدلال دون الحاجة إلى الوصول إلى بيانات التدريب.

في تحقيقهم، طبق الباحثون هجمات على ستة نماذج عامة تشمل أنظمة ترميز طيفية (spectral tokenizers) وأماكن تضمين النصوص (text embedding spaces) وكتالوجات منفصلة. وكانت النتائج مذهلة؛ إذ تبين أن الهجمات ضد طبقة المحاذاة يمكن أن تؤدي إلى انهيار كل نموذج بفعل ت perturbation، مما يبرز ضعف OpenGraph، الذي انهار عند ميزانية أقل بخمسة أضعاف.

الأمر الأهم، هو أن الهجمات التي تستهدف فضاء المدخلات، مثل تعديل الحواف (edges) أو المميزات (features) أو النصوص، يمكن أن تؤدي إلى حذف نصف التوقعات الصحيحة على ثلاثة من النماذج الستة في ذروة الأداء.

هذه النتائج تفتح نقاشات حول كيفية تصميم نماذج أكثر قوة في المستقبل. فإلى أي مدى يمكن أن تكون هذه الثغرات مشكلة قادمة؟