في ظل التطور التكنولوجي السريع في مجال الذكاء الاصطناعي، تُستخدم نماذج التحويل البصري (Vision Transformers - ViTs) بشكل متزايد في أنظمة الاستدلال المنفصل. تسمح هذه الأنظمة للأجهزة الطرفية بإرسال تمثيلات التوكنات الوسيطة إلى السحابة البعيدة، مما يتطلب تحسين أداء المعالجة وتقليل تكاليف الاتصال. في هذا السياق، تعتبر تقنيات خفض التوكنات (Token Reduction) وإعادة ترتيبها (Token Shuffling) من الاستراتيجيات المستخدمة لتقليل تكاليف الحساب والاتصال.

ومع ذلك، تظل فوائد هذه التقنيات على الخصوصية غير واضحة عند مواجهتها لهجمات عكس الميزات (Feature Inversion Attacks)، التي تهدف إلى إعادة بناء المدخلات من التمثيلات المُرسلة. أظهرت دراسة حديثة أن هذه التمثيلات حتى بعد إعادة ترتيبها تحتفظ بمعلومات مكانية ملحوظة.

استناداً إلى هذه الملاحظة، تم تقديم هجوم جديد يُعرف بالهجوم المعتمد على إعادة البناء المتناغم المكاني (Spatially Aligned Reconstruction Attack - SARA)، وهو نظام موحد يتنبأ بمواقع التوكنات، ويعيد ترتيب تخطيطها المكاني، ويعيد بناء التمثيلات المفقودة باستخدام مُرمز تلقائي مميز. كشف البحث أن إعادة ترتيب التوكنات قد توفر خصوصية ظاهرية، حيث يتمكن الهجوم SARA الذي تم تطويره من إعادة بناء تنظيم التوكنات الأصلي بشكل كبير.

على الرغم من أن خفض عدد التوكنات يقدم حماية أقوى، إلا أنه يُظهر تسريباً ملحوظاً عندما تحتفظ التوكنات المُحتفظ بها بمعلومات دلالية ومكانية كافية. أخيراً، تم اقتراح دفاع خفيف الوزن على جانب الجهاز الطرفي يقوم بإزالة التمثيلات المكانية وتعديل كتل التحويل على الجانب الطرفي بشكل تدريجي من خلال التقطير المعرفي (Knowledge Distillation)، مما يقلل بشكل كبير من أداء الهجمات ضد SARA، في حين يحافظ على دقة المهام اللاحقة دون الحاجة إلى تغييرات على نموذج السحابة.