في خطوة جديدة تعزز من تجربة نمذجة العوالم، أعلنت AlayaWorld عن النسخة المحسنة من نموذجها التفاعلي (Interactive Long-Horizon World Modeling) في التقرير التقني الجديد. بينما بقيت بنية النموذج وبيانات التدريب كما هي، إلا أن طريقة تمثيل وإدماج إشارات الشروط خضعت لتعديلات جوهرية.
التصميم الجديد يستند إلى مبدأ بسيط: يجب أن تتناسب إشارات الشروط مع المحتوى المنتج بأكبر قدر ممكن من الدقة في التمثيل الكامن (latent representation) والبنية الزمنية (temporal structure). لتحقيق ذلك، قامت AlayaWorld بإجراء تغييرات بارزة تشمل:
1. **استبدال الذاكرة المكانية المعتمدة على التحريف العمق** بمُعالج 3D لنقاط التخزين المتصلة (streaming 3D point-cache renderer).
2. **إعادة تصميم مسار الشروط** لضمان تشفير الشروط البصرية في نفس الفضاء الكامن للـ VAE (Causal-VAE) مع وجود إحصائيات زمنية تتوافق مع تلك الخاصة بالفيديو المُنتَج.
النموذج الجديد يحتوي على ست تحسينات رئيسية:
- استبدال الشروط الثابتة للصورة بشروط كامنة تعتمد على الحركة.
- تشفير الذاكرة المكانية المعاد عرضها كسلسلة مستمرة.
- مواءمة نافذة الذاكرة الزمنية في مساحة البكسل.
- اعتماد انقطاع الذاكرة الصلبة لإزالة رموز الذاكرة بدلًا من تصفيرها.
- توحيد بروتوكول التشفير والفك بين التدريب والاستدلال.
- إزالة فرع الكاميرا AdaLN، بحيث يتم التحكم في الزاوية من خلال الشرط المكاني المعاد عرضه.
يُظهر هذا التطور مدى أهمية الابتكار في نماذج الذكاء الاصطناعي، ومدى تأثير ذلك على تحقيق نتائج دقيقة وعالية الجودة. ما رأيكم في هذه التحسينات؟ شاركونا في التعليقات.
اكتشف تفاصيل النموذج التفاعلي الجديد AlayaWorld: تحسينات ثورية في نمذجة العوالم
تقدم AlayaWorld نسخة محسنة من نموذجها التفاعلي طويلة الأمد، مع تغييرات جذرية في كيفية تمثيل وإدماج إشارات الشروط. تعرف على الاختلافات الرئيسية التي تعزز من فعالية النموذج الجديد.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
