في الآونة الأخيرة، شهدت نماذج اللغة متعددة الوسائط (Multimodal Large Language Models) ونماذج الانتشار (Diffusion Models) تقدماً ملحوظاً، حيث تميزت هذه النماذج بقدرتها على التأقلم مع الإدخالات المتنوعة. مقارنةً ببعضها البعض، تتمتع نماذج اللغة بقدرة فائقة على التفكير والتحليل بناءً على معلومات متعددة الحواس، بينما تركز نماذج الانتشار على إنتاج الصور والفيديوهات بدقة فوتوغرافية مدهشة.

اليوم نعلن عن "بيرنيني"، إطار جديد يجمع بين هاتين التقنيتين بشكل مبتكر. يرتكز المفهوم الجديد على تقسيم العمل بين نماذج اللغة ونماذج الانتشار: تتولى نماذج اللغة عملية التخطيط الســـماتي، بينما يقوم نموذج الانتشار بإنتاج البكسلات بناءً على التوجيهات الســـمات العليا وخصائص الصورة البصرية.

يعتمد إطار "بيرنيني" على تخطيط الســـمات بطريقة فعلية عن طريق تنبؤ نموذج MLLM بتمثيل الســـمات المطلوب مباشرة في مساحة ترميز ViT، ويتولى نموذج DiT مسألة إنتاج البكسلات بناءً على هذا التوقع، مما يضمن الحفاظ على التفاصيل من خلال دمج ميزات نصية وسمات مصدر VAE.

استخدام تقنية Segment-Aware 3D Rotary Positional Embedding (SA-3D RoPE) يساعد على تحسين معالجة المدخلات البصرية المتعددة، بالإضافة إلى توظيف أسلوب التفكير التسلسلي في التخطيط لتعزيز القدرة على نقل الفهم إلى توليد المحتوى.

لقد أثبت "بيرنيني" أنه يتمتع بأداء ممتاز في مجموعة واسعة من المعايير المتعلقة بتوليد الفيديو وتحريره، حيث تُترجم الفهم المسبق لنموذج MLLM إلى قدرات تعميم قوية حتى في المهام التحريرية التحديّة.

ما رأيكم في هذا التطور المبتكر في مجال الذكاء الاصطناعي؟ شاركونا آرائكم في التعليقات!