تشير الأبحاث إلى أن نماذج التعرف البصري (Visual Recognition Models) تتأثر بشكل كبير بتغير حجم الصورة، لكن العوامل التي تحكم هذه الحساسية تبقى غير واضحة عبر معماريات مختلفة. في هذا السياق، جاءت دراسة جديدة للتعمق في هذا الموضوع، حيث استعرضت 20 مصنفًا مدربًا مسبقًا على مجموعة بيانات ImageNet-1K، مستخدمة سبع عائلات معمارية مختلفة تشمل نماذج تعتمد على اللف (Convolutional)، والمحمولة (Mobile)، والكفاءة (Efficient)، ونماذج Transformer.

قامت الدراسة بخفض متسلسل لحجم الصورة المدخلة لبناء منحنيات استجابة دقة الحجم، وتحديد حجم مميز (Characteristic Scale) كمقياس مدمج لبداية تدهور في دقة التعرف. كشفت النتائج وجود علاقة عكسية قوية بين دقة التعرف الأساسية (Baseline Recognition Accuracy) وحجم الصورة المميز، حيث تم إيجاد معامل Pearson r يساوي -0.890.

بقيت هذه العلاقة مستقرة في التحليلات الإضافية واستثناء بنايات معمارية معينة. وعلى الرغم من أهمية عدد المعاملات (Parameter Count)، إلا أنه لم يوفر قوة تفسيرية إضافية ملحوظة بعد السيطرة على دقة التعرف الأساسية. كما تبين أن العائلة المعمارية لم تقدم فائدة تفسيرية كبيرة. من جهة أخرى، لم يظهر حجم الصورة المميز أي ارتباط يذكر مع استقرار التمثيل (Representation Stability).

تشير هذه النتائج إلى أن قوة التحمل ضد حجم الصورة تعكس بشكل رئيسي أداء دقة التعرف الأساسية بدلاً من حجم النموذج أو العائلة المعمارية. توفر هذه الدراسة إطار عمل تجريبي لتوصيف قوة التحمل بحجم الصورة عبر معماريات الرؤية، وينبغي أن تشجع على مزيد من التحقيقات النظرية في هذا المجال.