في عالم الذكاء الاصطناعي، عادت تقنية انتشار البكسل (Pixel-space diffusion) لتصبح بديلاً قويًا لتقنية انتشار الفضاء الكامن (Latent diffusion)، مقدمة جودة عالية في التوليد بدون الحاجة إلى شفرات مدربة مسبقًا. لكن، كانت النماذج التقليدية تعاني من نقص في الإشراف الدلالي القوي، ولم تصمم بشكل محدد لالتقاط البنية البصرية العليا.
تسعى الطرق الحديثة للتوافق التمثيلي (مثل REPA) إلى تحسين تدريب الانتشار من خلال الاعتماد على الميزات البصرية المدربة مسبقًا. وبناءً على ذلك، ظهرت طريقة Co-Denoising كمجال واعد للجمع بين هذه الميزات في عملية التوليد. ومع ذلك، تثير الأساليب الحالية للـ Co-Denoising بعض الالتباسات بسبب تعقيدها. لذا، نقدم V-Co، وهي دراسة منهجية في هذا الاتجاه من خلال إطار عمل موحد يعتمد على JiT.
تتيح لنا هذه البيئة المنضبطة عزل المكونات الجوهرية للـ Co-Denoising البصري. تكشف دراستنا عن عنصرين رئيسيين: الأول هو أن Co-Denoising يزرع فوائد من خلال الحفاظ على حسابات معينة مع تعزيز التفاعل بين تيارات البيانات، مما يؤدي إلى تصميم معماري مزدوج كامل مع تنبؤ غير مشروط مُحدد هيكليًا لتوجيه خالٍ من المصنفات.
أما الثاني فهو الحاجة إلى إشراف دلالي أقوى ومعايرة مناسبة بين التيارات، وقد حققنا ذلك من خلال خسارة هجينة تعتمد على الانجراف الإدراكي (Perceptual-drifting hybrid loss) وإعادة جدولة الميزات المعتمدة على RMS. تعزز هذه النتائج وصفة بسيطة وفعالة لتقنية Co-Denoising البصري.
أظهرت التجارب على مجموعة بيانات ImageNet-256 أن V-Co تتفوق على النموذج الأساسي في انتشار الفضاء البكسلي وتقنيات الانتشار الأخرى القوية، مع تقليل عدد دورات التدريب، مما يقدم توجيهات عملية لنماذج توليد التمثيل المستقبلية.
استكشاف V-Co: تطوير فريد في توافق التمثيل البصري عبر تقنية Co-Denoising!
تقدم V-Co دراسة متميزة عن تعزيز التوافق البصري باستخدام طريقة Co-Denoising. النتائج تسلط الضوء على أهمية الإشراف الدلالي القوي وتحسينات الأداء في النماذج التوليدية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
