في عالم التصميم الإبداعي، يبقى التحكم في إنشاء الصور بدقة تحدياً كبيراً أمام المحترفين. فغالباً ما يتطلب الأمر إمكانية التحكم في تفاصيل معينة مثل المواد، وهويات الأجسام، والتوزيعات المكانية التي تُصعب تحقيقها عبر التفاعل النصي فقط. هنا تأتي فائدة نماذج Diffusion Transformers (DiTs)، التي تستطيع استيعاب بيانات مختلطة، سواء كانت نصوصاً أم صوراً، ولكنها تفتقر للطريقة المناسبة التي تحدد أين وكيف تؤثر هذه البيانات على النتيجة النهائية.

في هذه المقالة، نُظهر كيف تُدخل تقنية "appearance pointers"، وهي رموز مدمجة تهدف لتوجيه نماذج DiTs نحو المظاهر الصحيحة في المواقع الجغرافية المناسبة. من خلال مواءمة المدخلات النصية أو الصورة مع أقنعة محددة من قبل المستخدم، تنتج هذه التقنية من خلال شبكة التوافق الإقليمي وتُحسن من خلال آلية تجميع مكاني. يُمكن هذا الأسلوب النموذج من معالجة عدة أوصاف إقليمية دون زيادة ملحوظة في الحمل الزمني.

ما يميز هذا النهج هو تقديم واجهة متعددة الأنماط لا تتطلب إعادة تدريب النموذج الأساسي بالكامل، ولمسافات محددة على عدة مقاييس، يُظهر نموذجنا أداءً مُتواضعاً أو متفوقاً على الأساليب التقليدية المختصة في هذا المجال. مساءً فإن هذه التقنية تقدم مساراً بسيطاً وقابلاً للتوسع نحو توجيه دقيق وموقع واعٍ في إنشاء الصور.

بالنهاية، تقدم هذه المبادرة الفرصة للمهنيين لاستكشاف أساليب جديدة وفعالة في فن إنشاء الصور، مما يعزز من جودة العمل الفني ويتيح لهم الإمكانية للتعبير عن رؤاهم بشكل أدق.