في عالم الذكاء الاصطناعي، يبرز تساؤل مهم: هل يمكن لنماذج الانتشار (Diffusion Models) إخفاء إشارات تشير إلى صلاحية فيزيائية؟ هذا ما تم استكشافه في دراسة جديدة، حيث تم اختبار تميز نماذج الفيديو في تمثيل الدلالات الفيزيائية.

قام الباحثون بتحليل تمثيلات التنظيف الوسطى لنماذج Transformers المدربة مسبقاً، حيث توصلت النتائج إلى أن الفيديوهات الواقعية والغير واقعية يمكن فصلها جزئياً في فضاء الملامح المتوسطة، حتى عند مستويات ضوضاء مرتفعة.

استخدم الباحثون ضوابط داخل المصدر وضوابط الجودة الإدراكية للإشارة إلى أن هذا التمايز لا يُفسر بالكامل بواسطة هوية المولد أو الجودة البصرية العامة.

لتحسين الأداء، قام الباحثون بتطوير مُحقق فيزيائي خفيف الوزن يتم تدريبه على الملامح المجمدة، واستخدموه في آليتين تكميليتين تحت ميزانية متعددة المسارات ثابتة. تشمل هذه الآليات اختيار المسار التدريجي، الذي يقوم بتقييم المسارات عند نقاط تفتيش وسطية وقصير المرشحين الضعيفين مبكراً، وإرشاد تدرج المكافأة، الذي يوجه المسارات الباقية عن طريق الارتجاع من خلال أول بضع كتل فقط من نموذج الانتشار (DiT).

أثبتت التجارب على مجموعتي PhyGenBench وPhysics-IQ عبر نماذج CogVideoX-2B و5B وWan 2.1-14B أن الاختيار التدريجي يعادل نتائج الـ Best-of-4 المعتمدة على المحقق الفيزائي على CogVideoX-2B، مع تقليل زمن الاستدلال بنسبة 37٪، بينما حسن إرشاد تدرج المكافأة من الاتساق الفيزيائي على CogVideoX-5B، كل ذلك دون الحاجة لتعديل مباشر على مولد الفيديو.