تتزايد أهمية تفسيرات الصور المعتمدة على المفاهيم (Concept-based Visual Explanations)، حيث تسهم في الإجابة عن سؤال محوري: "ما هو التغيير الدقيق الذي يمكن أن يقلب توقع النموذج؟" يعتبر هذا السؤال بالغ الأهمية خاصة في المجالات الحساسة مثل الطب. حتى الآن، كانت الطرق المعتمدة على نماذج الانتشار (Diffusion Models) تتطلب مصنفات خارجية قد تفشل في التعامل مع الصور الضوضائية. لكن، مع تقديمنا لتقنية C-VCE الجديدة، أصبح لدينا حل مبتكر يدمج المصنف مباشرة في نموذج الإنتاج عبر طبقة مفاهيم (Concept Bottleneck Layer).

يسمح هذا النموذج للمستخدمين بتفعيل أو إلغاء تفعيل المفاهيم الدلالية أثناء عملية العينة، مما يمكنهم من تعديل مناطق معينة من الصورة مع الحفاظ على باقي أجزاء الصورة، مع احترام علاقات الميزات. لضمان أن التعديلات تبقى تحت السيطرة، أضفنا منظم احتمالي بسيط يوازن بين "تغيير التوقع" و"الاقتراب من الأصل"، إلى جانب قناع قائم على التدرجات يحدد التعديلات في المناطق الأكثر صلة.

عند تقييم النموذج على مجموعات بيانات مثل CelebA، أظهر C-VCE أداءً جيدًا يماثل أو يتجاوز معدلات التغيير، مما ينتج تفسيرات بصرية أقرب إلى الإدخال وأقل تشويشًا مقارنة بالأساليب التقليدية التي تعتمد على مصنفات الصور الضوضائية.

يجعل هذا النموذج C-VCE أداة عملية لأنظمة الرؤية حيث يحتاج المستخدمون إلى صور "ماذا لو" دون الاعتماد على مصنف خارجي معقد. الأهم من ذلك، تشير نتائجنا إلى أن الكشف والتحكم في طبقة المفاهيم الداخلية هو وسيلة واعدة لجعل نماذج الإنتاج القوية أكثر سهولة للفهم وآمنة للاستخدام.