أصبح الاهتمام بنماذج الانتشار لتوليد الصور Text-to-image يزداد بشكل ملحوظ، نظراً لقدرتها على إنتاج صور متنوعة وذات دقة عالية. لكن، تحديات جديدة تواجه هذه النماذج، خاصة عند التوليد متعدد المفاهيم، حيث يظهر مفهوم واحد غالبًا ما يهيمن على الناتج بينما يتم قمع المفاهيم الأخرى. هذه الظاهرة تُعرف باسم 'الهيمنة مقابل الهيمنة المنخفضة' (Dominant-vs-Dominated أو DvD).
لإلقاء الضوء على هذه المشكلة، قدم الباحثون أداة جديدة تُسمى DominanceBench، والتي تهدف إلى دراسة الأسباب الجذرية لهذه الظاهرة من منظورات متعددة تشمل بيانات التدريب وآليات العمل الداخلية.
أظهرت الدراسة التي تتسم بالتحكم الدقيق في عملية الضبط (fine-tuning) أن المفاهيم المستفادة من صور تدريب متجانسة بصريًا (منخفضة التVariation) تميل إلى إظهار هيمنة أكبر عند دمجها مع مفاهيم أخرى. كما أظهرت التحليلات أن الرموز السائدة تركز الانتباه في خطوات إزالة الضجيج المبكرة، متبوعة بانخفاض في تمثيل المفاهيم المتنافسة.
علاوة على ذلك، تماثل تحليلات التخلص من الرؤوس (head-ablation) أن هذه الهيمنة توزع عبر رؤوس الانتباه بدلاً من أن تكون محصورة.
بشكل عام، تؤكد هذه النتائج أن DvD تمثل نمط فشل على مستوى المفاهيم، مما يوفر أساسًا لتوليد متعدد المفاهيم بشكل أكثر موثوقية وقابلية للتحكم. من المتوقع إصدار DominanceBench بمجرد نشر البحث، مما يعد بفتح آفاق جديدة في هذا المجال المتطور.
توازن القوى في نماذج الانتشار: كيف تؤثر الهيمنة على توليد الصور المتعددة المفاهيم؟
كشف بحث حديث عن ظاهرة 'الهيمنة مقابل الهيمنة المنخفضة' في نماذج الانتشار لإنشاء صور متعددة المفاهيم. الدراسة تسلط الضوء على العوامل المسؤولة عن هذه الظاهرة وكيف يمكن التغلب عليها.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
