في الآونة الأخيرة، حققت النماذج الموحدة متعددة الوسائط (Unified Multimodal Models - UMMs) تقدمًا ملحوظًا في توليد الصور من النصوص (Text-to-Image - T2I). ولكن، كانت الطرق المعتمدة على الاستدلال عبر سلسلة الأفكار (Chain-of-Thought - CoT) تواجه تحديات كبيرة في دقة التصميمات المعقدة. هنا يأتي دور CoCo (Code-as-CoT)، وهو إطار استدلال يعتمد على البرمجة، يمكّن المستخدمين من تمثيل عملية التفكير ككود قابل للتنفيذ.

يبدأ CoCo بتوليد كود يوضح التخطيط الهيكلي للمشهد استنادًا إلى نص المدخلات. يتم تنفيذ هذا الكود في بيئة محصورة (sandboxed environment) لعرض صورة أولية مُحددة. بعد ذلك، يتم تحسين هذه الصورة الأولية من خلال تحرير دقيق يضمن الوصول للنتيجة النهائية عالية الجودة.

للتحقق من فعالية هذا الإطار التعليمي، تم إنشاء مجموعة بيانات CoCo-10K، التي تحتوي على أزواج من الصور المبدئية والنهائية، مما يساعد في تعليم كيفية بناء تخطيطات مرتبة وتحسينات بصرية دقيقة.

أظهرت النتائج التجريبية على ثلاثة معايير، StructT2IBench وOneIG-Bench وLongText-Bench، تحسينات كبيرة بنسبة 68.83% و54.8% و41.23% على التوالي مقارنةً بطريقة التوليد المباشر. يثبت هذا أن استخدام الكود القابل للتنفيذ هو نهج فعال وموثوق لتوليد الصور من النصوص بدقة أكبر.

في الختام، يفتح CoCo آفاقًا جديدة في عالم توليد الصور، حيث يجمع بين البرمجة والاستدلال لخلق تصورات بصرية تتجاوز التوقعات التقليدية.

ما رأيكم في هذا التطور المذهل؟ شاركونا في التعليقات!