عالم الذكاء الاصطناعي يشهد تقدماً مذهلاً بفضل النماذج الحديثة لتوليد الفيديو، وخاصة مع تطورات التحكم بالكاميرا. لكن، ما هي الحلول لمشاكل عدم الاتساق الثلاثي الأبعاد (3D inconsistency) التي تلقي بظلالها على هذه التقنيات؟ في هذا الإطار، يقدم الباحثون نموذج LoGo الجديد، الذي يعالج هذه المسألة بفعالية.

عند تغيير موضع الكاميرا، قد تفقد الأجسام استمراريتها وتتغير هياكل المشهد. الحل التقليدي كان يعتمد على تقنيات ما بعد التدريب (post-training techniques) التي تعطي مكافأة واحدة لجميع المخرجات، ولكنها أظهرت عدم كفاءتها في تصحيح هذه المشاكل على المدى الطويل.

يقدم LoGo نهجًا مبتكرًا من خلال دمج المكافآت المحلية والعالمية (global and spatially localized rewards) التي تحقق توازنًا مثاليًا، حيث تسهم المكافأة المحلية في تقديم تقييمات دقيقة لتحسين الاتساق الثلاثي الأبعاد، بينما تحافظ المكافأة العالمية على جودة الفيديو واتباع الكاميرا.

أظهرت التجارب مع ثلاثة نماذج أساسية أن LoGo يتفوق بوضوح على معايير DL3DV وTrajectoryBench، وهو معيار جديد لتوليد الفيديو بتعقيد كبير والتحكم بالكاميرا على مدى طويل. هذا الابتكار يسهم في تقليل التحولات المحلية للأجسام، وتقليل العيوب، وتغييرات المشهد العالمية، مما يعكس أهمية تقييم المكافآت في نماذج الفيديو بعد التدريب.

لمعرفة المزيد عن LoGo، يمكنكم زيارة موقع المشروع.