في الآونة الأخيرة، شهدنا تطورًا ملحوظًا في نماذج الجيل الآني (One-Step Generative Models) التي تعمل على ضغط مسار التشتت المتعدد الخطوات من خلال تقنيات مثل التقطير أو خرائط التدفق المتعلمة. هذه النماذج وصلت إلى نقطة تحول حيث يمكنها إنتاج صور عالية الجودة، مما يثير تساؤلات طبيعية حول ما يحدث لمسار إزالة الضوضاء (Denoising) في عمليات التشتت المتعددة عندما يتم ضغط الجيل إلى مجرد خطوة واحدة.

يقدم الباحثون ملاحظة تجريبية يطلقون عليها اسم 'العمق كزمن'، حيث يبدو أن حسابات إزالة الضوضاء الناتجة عن عمليات التشتت تجري عبر عمق عملية واحدة فقط، مما يمكن من استعادة المعلومات من الطبقات الوسيطة باستخدام رأس الإخراج الخاص بالنموذج.

من المثير للاهتمام أنه مدعومًا بالتحقيق في مهمة النقل التي تم تدريب خريطة التدفق على حلها، حيث يظهر نموذج MeanFlow حالة مفاجئة، تكشف فيه الفترات الزمنية الأقصر أنه يمكن أن تحدث إزالة الضوضاء وتجديدها ضمن تقييم واحد للشبكة. على النقيض، المولدات التي تم تدريبها بشكل مختلف، مثل نماذج الانجراف، لا تظهر السلوك نفسه في عملية إزالة الضوضاء عبر الأعماق.

وبالتالي، تشير النتائج إلى أن النماذج التي تظهر الظاهرة سالفة الذكر أكثر قابلية للضغط عبر العمليات الطبقية: حيث يمكن ضغط نموذج MeanFlow SiT-L/2 بنسبة 16.6 ضعف من حيث المُعاملات إلى كتلة واحدة مشروطة زمنياً. يُقدم هذا البحث شرحًا لسلوك إزالة الضوضاء أولاً ثم تجديدها، ويظهر أنه عند اعتبار العمليات الطبقية كنوع من التدفق، يمكن تدريب كتلة زمنية مشروطة واحدة لإزالة الضوضاء عبر الطبقات.

تتحد هذه النتائج لتشير إلى أن الحساب الزمني لعمليات التشتت لا يتم التخلص منه عبر الجيل الأحادي الخطوة، ولكنه يعاد تنظيمه عبر عمق الشبكة، مما يمثل تقدمًا نوعيًا في مجال الذكاء الاصطناعي.

ما رأيكم في هذه التطورات الجديدة في تقنيات الذكاء الاصطناعي؟ شاركونا في التعليقات.