تشهد تقنيات تعديل الصور تقدماً ملحوظاً بفضل النماذج الجديدة مثل نماذج انتشار الصور (Diffusion Models) ونماذج التدفق (Flow Models)، والتي ساعدت على الارتقاء بمستوى تعديل الصور المعتمد على النص إلى آفاق جديدة. ومع ذلك، لا تزال الطرق الحالية التي تُحرر الصور بشكل مستقل تواجه تحديات كبيرة في الحفاظ على التناسق الهندسي والبصري عبر وجهات نظر مختلفة لنفس المشهد.

تعتبر هذه التحديات أكثر إلحاحًا عند التعامل مع تمثيلات ثلاثية الأبعاد مثل نماذج NeRFs (Neural Radiance Fields) أو نماذج Gaussian splat، حيث يظل التناسق ضرورة حيوية للمستخدمين. لذا، قدم الباحثون إطار عمل توجيهي لا يتطلب التدريب، يفرض التناسق المتعدد الوجهات خلال عملية تعديل الصور.

تعتمد الفكرة الرئيسية على التأكيد أن النقاط المتقابلة يجب أن تبدو متشابهة بعد التعديل. لتحقيق ذلك، تم تقديم خسارة التناسق التي توجه نحو تحريرات متسقة أثناء عملية إزالة الضوضاء. هذا الإطار مرن، ويمكن دمجه مع طرق تعديل الصور المختلفة، مما يدعم إعدادات تعديل متعددة الوجهات الكثيفة والنادرة على حد سواء.

أظهرت النتائج التجريبية أن نهجنا يحسن بشكل كبير التناسق ثلاثي الأبعاد مقارنةً بالطرق الحالية لتعديل الصور متعددة الوجهات. كما أظهرت التحسينات في التناسق أن تعديل Gaussian splat يمكن أن يحقق تفاصيل حادة وموثوقية قوية تجاه نصوص المستخدم المحددة. لمزيد من التفاصيل، يرجى زيارة صفحة مشروعنا للحصول على نتائج الفيديو: https://3d-consistent-editing.github.io/