في خطوة جديدة نحو تحسين قدرات الذكاء الاصطناعي في مجال توليد الصور، تم تقديم نموذج LLaDA-Image. يدمج هذا النموذج بين تقنية التحويل Difussion Transformer ذات الـ 6 مليار معلمة ونموذج فهم الرؤية واللغة LLaDA2.0-Mini، مما يسمح بتوليد صور شديدة الواقعية.

بدلاً من الاعتماد على بيانات صورة ونص متزاوجة في البداية، ركز فريق البحث على بناء قاعدة قوية لتوليد الصور من خلال مرحلة التدريب المسبق باستخدام صور فقط. يعتمد نموذج LLaDA-Image على أكثر من 220 مليون عينة، منها 98 عينة حقيقية.

لتعزيز الأداء، استخدم المطورون تقنية RMSNorm الخالية من المعلمات مع محسن Muon، مما ساهم في تحسين عملية التوليد وتقديم صور ذات جودة فائقة. علاوة على ذلك، تم تنفيذ نسخة محسّنة تُعرف بـ LLaDA-Image-Turbo، التي تُمكّن من استنتاج سريع في 2-4 خطوات عينة.

على منصة Qwen-Image-Bench، حقق النموذج الجديد درجات عالية تصل إلى 53.53 و53.38 في المسارات الإنجليزية والصينية، على التوالي، مما يجعله نموذجًا رائدًا مفتوح المصدر.

لتوسيع دائرة البحث حول نماذج التوليد القادرة والفعالة، تم الكشف عن أوزان النموذج، ورمز التدريب، والوصفات التفصيلية.

إن هذا التطور يمثل خطوة بارزة في مجال الذكاء الاصطناعي وتوليد الصور، ويجعل المجتمع التقني يتطلع إلى مستقبل أفضل في هذا المجال.