تعتبر نماذج المحولات للرؤية (Vision Transformers - ViTs) جزءاً أساسياً من معظم نماذج الرؤية الحديثة. لكن لا يزال هناك تحدٍ رئيسي يتمثل في الحصول على تفسيرات دقيقة ومستقرة ودقيقة في نسبتها.

لقد تم تعديل طريقة نقل الأهمية عبر الطبقات (Layer-wise Relevance Propagation - LRP) لتتوافق مع انتباه المحولات، لكن في حالة نماذج ViTs، غالباً ما يؤدي ذلك إلى تفسيرات ضوضائية وغير موثوقة. في دراسة جديدة، تم اكتشاف أن العامل المفقود هو كيفية معالجة الاتصالات المتبقية، حيث تؤدي آثار الإلغاء في المسارات المتبقية إلى انفجار في نسب الأهمية.

علاوة على ذلك، تم تحديد أن هذه الإلغاءات أقوى بكثير في نماذج ViTs مقارنةً بنماذج اللغة. لمواجهة هذه المشكلة، تم تقديم طريقة جديدة تُعرف بـ ResLRP، وهي تمديد بسيط لـ LRP، حيث تأخذ قواعد النقل فيها بعين الاعتبار الإلغاءات في الفروع المتبقية وتحد من انفجار التفاصيل بشكل موثوق.

تشير التدخلات المستندة إلى القناة إلى أن إلغاء المتبقي، وليس تأثير تنظيم عام، هو ما يقود عدم الاستقرار. تظهر النتائج أن ResLRP يُحسن جودة التفسير بشكل كبير عبر الجانب الدقيق والموثوق للنماذج، مع تحقيق مكاسب ملحوظة تتراوح بين 27-29% في تحديد المواقع، وارتفاع يصل إلى 3.4 مرة في نقاط الموثوقية.

ليس فقط في المعايير الخاصة، بل تتمكن ResLRP أيضاً من تحديد ميزات المتجهات الساكنة بشكل دقيق في مساحة الإدخال، بينما تُعتبر قياسات تعزيز المتبقي أدوات تشخيصية ذات مستوى معماري تُساعد في التنبؤ بمكان تدهور التفسير.