تشهد نماذج التحويل البصري (Vision Transformers) تطوراً ملحوظاً في سعيها لتقديم أداء أفضل تحت ظروف توزيع البيانات المتغيرة. من خلال تقديم تقنيات جديدة لتقليل عدد التوكنات (tokens)، تمثل هذه الدراسة تقدمًا مهمًا في تحقيق توازن بين الكفاءة ودقة الأداء.

تعمل الطرق التقليدية لتقليل التوكنات بشكل رئيسي على البيانات النظيفة، مما جعلها تعاني من فجوة كبيرة في دقتها عند مواجهة بيانات حقيقية ذات توزيعات مختلفة. ومع ذلك، تكشف الأبحاث الحديثة أن فارق الدقة هذا يعتمد على جدول تقليل محدد، والذي يتم تركه عادةً ثابتاً كجزء من التفاصيل التنفيذية.

تقدم الدراسة الحالية جدولًا متأخرًا ذو موصلات قوة متباينة، والذي أثبت فعاليته في تحسين دقة الأداء عند حدوث تحول في التوزيعات. على سبيل المثال، استخدام هذا الجدول على مجموعة بيانات ImageNet-C مع نموذج DeiT-S أدى إلى تقليل تكلفة الحساب بنسبة 26% مع إغلاق 83% من فجوة الدقة.

ليس هذا فحسب، بل إن الجدول المتأخر أثبت أيضًا نجاحه في التغلب على مشاكل تقليل التوكنات عبر خمس طرق مختلفة، مع إضافة فايدة جديدة تتعلق باختلاف التحولات. هذه النتائج تعد خطوة مهمة نحو تحسين دقة النماذج وتعزيز استخدامها في التطبيقات الواقعية حيث تتغير بيانات الإدخال بشكل دائم.

لذا، هل تودون استكشاف المزيد حول تأثير التحولات على أداء نماذج التحويل البصري؟ شاركونا آراءكم في التعليقات!