تتعرض نماذج الذكاء الاصطناعي، وبشكل خاص نماذج الانتشار (Diffusion Models)، لجملة من التطورات المستمرة، وعُرفت العلاقة بينها وبين تحسين التمثيل الدلالي (Semantic Representation) بكونها غير متكافئة. إذ غالبًا ما يتم استخدام التمثيلات الدلالية لتحسين جودة التوليد، بينما تُعتبر تمثيلات النماذج بحد ذاتها نتاجًا ثانويًا لعملية التوليد. لكن هناك الكثير من الجهد المبذول لاستكشاف إمكانية تحسين هذه التمثيلات دون المساس بجودة التوليد.
في هذا السياق، قدمت تقنية جديدة تسمى SelfFlow التي تدمج محاذاة الباتش الذاتي (Self-Supervised Patch Alignment) لتعزيز كفاءة النماذج. ورغم أن فوائد SelfFlow الرئيسية تتركز في تسريع عملية التوافق وتحسين جودة الناتج، إلا أن البحث جاء ليقدم تحسينًا إضافيًا عبر إدماج طريقة جديدة تعتمد على محاذاة توكن الفئة بين مشاهدتين مختلفتين.
طريقة البحث تقوم على إنشاء مشاهدتين مزدوجتين من الضوضاء المستقلة لكل صورة، حيث يتم محاذاة تمثيل توكن الفئة للطالب مع هدف المعلم المعتمد على متوسط التوقف من الملاحظة الأخرى. وتحقيقًا لهذه الأهداف، يتم تحسين جميع الأهداف بشكل مشترك، مما يسهل تحسين تمثيل فئة التوكنات الجديدة.
تشير النتائج إلى تحسن ملحوظ في دقة استنتاج الصور عبر نموذج ImageNet، حيث لوحظت زيادة بنسبة 9.4% عند استخدام توكن الفئة، و10.1% عند استخدام توكنات الباتش متوسط التجميع. وفوق ذلك، شهدت نماذج التصنيف الأخرى تحسنًا في دقة التنبؤ (mIoU) بمقدار 3.6. وتجدر الإشارة إلى أن هذه التحسينات في التمثيل تمت دون التأثير على جودة التوليد، وهو ما يظهر أن التمثيل يمكن أن يُعتبر قدرة رئيسية للنموذج وليس مجرد نتيجة ثانوية.
عند التدريب على تحويل النص إلى صورة (Text-to-Image)، ساهم تحسين الهدف نفسه في تقليل FID من 2.52 إلى 2.37. تشمل هذه النتائج توسيع نطاق تطبيق الذكاء الاصطناعي وتطوير جهود توليد الصور بشكل مبتكر.
في النهاية، هذا التطور يمثل خطوة هامة في عالم الذكاء الاصطناعي، وهو يشير إلى إمكانية تكامل جودة التوليد مع تحسين التمثيل الدلالي بشكل متزامن. ما رأيكم في هذا التطور؟ شاركونا في التعليقات.
تحول جذري في تدريب نماذج الانتشار: تحسين تمثيل الصورة وجودة التوليد
تكشف دراسة جديدة أن نماذج الانتشار يمكن أن تتعلم تمثيلات دلالية أقوى دون التأثير على جودة التوليد. تعتمد هذه الدراسة على طرق مبتكرة لتعزيز أداء نماذج الذكاء الاصطناعي.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
