في عالم الذكاء الاصطناعي، تتزايد أهمية نماذج توليد الفيديو (Video Generation Models) كأدوات لنمذجة العالم. فقد تمحورت الأبحاث الأخيرة حول فكرة أن النماذج يجب أن لا تعكس مساراً محتملاً فحسب، بل يجب أيضاً أن تعبر عن مجموعة من السلوكيات الممكنة التي يمكن أن تحدث تحت نفس الملاحظة الأولية والإجراء. We call this distribution-level requirement probabilistic alignment.
رغم ذلك، تركز التقييمات الحالية بشكل أكبر على جدوى الفيديوهات الفردية دون اختبار ما إذا كانت النماذج تستطيع استعادة التوزيع الصحيح عندما يتم توليد الفيديوهات بشكل متكرر. هذا يثير سؤالاً جوهرياً: إلى أي مدى تبعد نماذج توليد الفيديو الحالية عن نمذجة العالم المتوافقة مع الاحتمالات؟
للإجابة عن هذا السؤال، وضع الباحثون معيار probabilistic alignment كقاعدة معيارية للنماذج، وأطلقوا PAWBench كمرجع لتقييم نماذج الفيديو كعينات عشوائية لديناميكيات العالم. بالإضافة إلى ذلك، تم تقديم PAWEval، بروتوكول جديد يحول إعادة توليد الفيديو إلى توزيعات تجريبية عن السلوكيات الفيزيائية المحتملة.
عبر 50 سيناريو و11 نظاماً حالياً، لم تتمكن أي من النماذج من مطابقة الاحتمالات المرجعية بشكل متسق مع استعادة مدى السلوكيات الصالحة. ومن خلال تحديد هذه الفجوات، استعرض الباحثون ما إذا كانت تلميحات اللغة، أو ضبط الضوضاء الأولي، أو تدريب النموذج يمكن أن تعيد تشكيل توزيع التنبؤ للنموذج.
يعتبر هذا البحث خطوة أولى نحو تحسين نمذجة العالم المتوافقة مع الاحتمالات، مما يفتح الباب أمام جهود مستقبلية في مجال الذكاء الاصطناعي.
PAWBench: إلى أي مدى نحن بعيدون عن نمذجة العالم المتوافقة مع الاحتمالات؟
تكشف دراسة جديدة عن فجوات كبيرة في قدرة نماذج توليد الفيديو الحالية على محاكاة سلوكيات العالم بطريقة توزع احتمالي. يتم تقديم معيار جديد لتقييم هذه النماذج من خلال PAWBench.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
