في خطوة ثورية، تقدم AlayaWorld نموذجاً جديداً لنمذجة العوالم التفاعلية يستند إلى تقنيات تكنولوجيا الذكاء الاصطناعي الحديثة. عوضاً عن الاعتماد على طرق تقليدية في تطوير الألعاب التي تحتاج إلى جهد كبير في الإنتاج والديناميكية، يُمكن أن تُنتج نماذج العالم الفيديو التفاعلية هذه البيئات الافتراضية بكفاءة من المدخلات المباشرة من المستخدم مثل النصوص والصور والفيديو.

تسعى AlayaWorld إلى تحقيق رؤية تتطلب أربع ميزات مترابطة: التفاعل، استمرارية الزمان والمكان، توليد طويل المدى مستقر، والاستجابة الفعالة. باستخدام نموذج فيديو موحد حديث عبارة عن Transformer ، طوّر الفريق نموذج AlayaWorld ليولد فيديو بدقة 540p و720p بمعدل 24 إطاراً في الثانية.

يعتمد هذا النموذج على استخدام تقنيات مثل سياق بصري محدود يربط بين الإطارات السابقة والتاريخ الزمني المضغوط والذاكرة المكانية المتوافقة مع الأسطح الهندسية. كما تم تدريب النموذج للتقليل من الانحرافات المحتملة في المدى البعيد عبر استخدام تواريخ منقوصة واحتياطيات التنبؤ المتراكمة.

علاوةً على ذلك، تم إدخال صياغة خاصة لتقطير الآلية الذاتية المتقطعة، مما يقلل من خطوات الاستدلال من حوالي 30 خطوة إلى أربع خطوات لكل جزء. وقد أظهرت التجارب في iWorld-Bench أن AlayaWorld يتفوق على جميع النماذج الأخرى في توليد المدى البعيد.

كونه مشروعاً مفتوح المصدر وذو رؤية بعيدة المدى، يهدف AlayaWorld إلى توفير أساس قوي لأبحاث مستقبلية في نماذج الفيديو التفاعلية، مما يعيد تعريف الطريقة التي نتفاعل بها مع العوالم الافتراضية.