في خطوة جديدة نحو تحسين قدرات الذكاء الاصطناعي في مجال توليد الصور، تم تقديم نموذج LLaDA-Image. يدمج هذا النموذج بين تقنية التحويل Difussion Transformer ذات الـ 6 مليار معلمة ونموذج فهم الرؤية واللغة LLaDA2.0-Mini، مما يسمح بتوليد صور شديدة الواقعية.
بدلاً من الاعتماد على بيانات صورة ونص متزاوجة في البداية، ركز فريق البحث على بناء قاعدة قوية لتوليد الصور من خلال مرحلة التدريب المسبق باستخدام صور فقط. يعتمد نموذج LLaDA-Image على أكثر من 220 مليون عينة، منها 98 عينة حقيقية.
لتعزيز الأداء، استخدم المطورون تقنية RMSNorm الخالية من المعلمات مع محسن Muon، مما ساهم في تحسين عملية التوليد وتقديم صور ذات جودة فائقة. علاوة على ذلك، تم تنفيذ نسخة محسّنة تُعرف بـ LLaDA-Image-Turbo، التي تُمكّن من استنتاج سريع في 2-4 خطوات عينة.
على منصة Qwen-Image-Bench، حقق النموذج الجديد درجات عالية تصل إلى 53.53 و53.38 في المسارات الإنجليزية والصينية، على التوالي، مما يجعله نموذجًا رائدًا مفتوح المصدر.
لتوسيع دائرة البحث حول نماذج التوليد القادرة والفعالة، تم الكشف عن أوزان النموذج، ورمز التدريب، والوصفات التفصيلية.
إن هذا التطور يمثل خطوة بارزة في مجال الذكاء الاصطناعي وتوليد الصور، ويجعل المجتمع التقني يتطلع إلى مستقبل أفضل في هذا المجال.
LLaDA-Image: ثورة جديدة في توليد الصور بفضل تقنيات مفتوحة بالكامل!
يقدم LLaDA-Image إطارًا موحدًا يجمع بين نموذج التحويل Difussion Transformer مع تقنية قوية لفهم الرؤية واللغة. هذا التطور يضم تحسينات كبير في جودة الصور المولدة ودقة التعليمات التحريرية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
