في عالم الذكاء الاصطناعي، تُعد النماذج الانتشارية (Diffusion Transformers) من أبرز الابتكارات في توليد الصور. لكن، كيف يمكن لهذه النماذج تحقيق أداء استثنائي أثناء التدريب على صور ذات دقة منخفضة؟
تظهر الأبحاث الحديثة أن تكاليف التدريب ترتفع بشكل هائل مع زيادة دقة الصور، ولذا يتماللجوء إلى استخدام الصور منخفضة الدقة كحل مبتكر. يعتمد هذا الأسلوب على فرضية طيفية تشير إلى أن الصورة منخفضة الدقة تحتفظ تقريباً بجميع المعلومات الأساسية عند الضوضاء العالية. ولكن، تبقى نقطة مهمة لم تُحل بعد: هل تحافظ هذه الخطوة على إشارة التدرج الأصلية أثناء التدريب؟
لقد قام الباحثون بدراسة تأثير تقليص الدقة على إشارة التدرج ووجدوها تتكون من عاملين رئيسيين: الأول يتوقف على الضوضاء ويرتبط بنسبة تقلص الدقة، والثاني يُعرف بأنه حد ثابت يتأثر بعدد التوكنات المطلوب في الشبكة. النتائج تظهر أنه في مسار محدد، هناك فرصة للمحافظة على دقة التدرجات الأصلية عند استخدام دقة مخفضة، مما يؤدي إلى تقليل وقت التدريب بنسبة 14.6% بينما يبقى أداء النموذج قريباً من الأصل.
هذا البحث يفتح آفاقًا جديدة حول كيفية تحسين عملية التدريب في التعلم الآلي، وقد تم طرح الشيفرة البرمجية المتاحة للجمهور على GitHub. في ضوء هذه الاكتشافات، ينتظر العالم بفارغ الصبر ما قد تحمله لنا المزيد من الأبحاث المستقبلية في هذا المجال.
أسرار النموذج: كيف تحافظ الصور منخفضة الدقة على دقة التدرجات؟
تقدم النماذج الانتشارية (Diffusion Transformers) تقدمًا كبيرًا في توليد الصور، ولكن يكمن السر في الحفاظ على دقة التدرجات أثناء التدريب على صور منخفضة الدقة. اكتشافات جديدة تضيف الأدلة على هذه الظاهرة المدهشة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
