في عالم الذكاء الاصطناعي، يبرز تساؤل مهم: هل يمكن لنماذج الانتشار (Diffusion Models) إخفاء إشارات تشير إلى صلاحية فيزيائية؟ هذا ما تم استكشافه في دراسة جديدة، حيث تم اختبار تميز نماذج الفيديو في تمثيل الدلالات الفيزيائية.
قام الباحثون بتحليل تمثيلات التنظيف الوسطى لنماذج Transformers المدربة مسبقاً، حيث توصلت النتائج إلى أن الفيديوهات الواقعية والغير واقعية يمكن فصلها جزئياً في فضاء الملامح المتوسطة، حتى عند مستويات ضوضاء مرتفعة.
استخدم الباحثون ضوابط داخل المصدر وضوابط الجودة الإدراكية للإشارة إلى أن هذا التمايز لا يُفسر بالكامل بواسطة هوية المولد أو الجودة البصرية العامة.
لتحسين الأداء، قام الباحثون بتطوير مُحقق فيزيائي خفيف الوزن يتم تدريبه على الملامح المجمدة، واستخدموه في آليتين تكميليتين تحت ميزانية متعددة المسارات ثابتة. تشمل هذه الآليات اختيار المسار التدريجي، الذي يقوم بتقييم المسارات عند نقاط تفتيش وسطية وقصير المرشحين الضعيفين مبكراً، وإرشاد تدرج المكافأة، الذي يوجه المسارات الباقية عن طريق الارتجاع من خلال أول بضع كتل فقط من نموذج الانتشار (DiT).
أثبتت التجارب على مجموعتي PhyGenBench وPhysics-IQ عبر نماذج CogVideoX-2B و5B وWan 2.1-14B أن الاختيار التدريجي يعادل نتائج الـ Best-of-4 المعتمدة على المحقق الفيزائي على CogVideoX-2B، مع تقليل زمن الاستدلال بنسبة 37٪، بينما حسن إرشاد تدرج المكافأة من الاتساق الفيزيائي على CogVideoX-5B، كل ذلك دون الحاجة لتعديل مباشر على مولد الفيديو.
اكتشاف الفيزياء في ضوضاء الانتشار: كيف يمكن لنماذج الفيديو الجديدة تعزيز واقعية المشاهد؟
تستكشف أبحاث جديدة كيف يمكن لنماذج الانتشار (Diffusion Models) أن تميز بين الفيديوهات ذات الصلاحية الفيزيائية وتلك غير القابلة للصدفة، مما يعزز من جودة المحتوى المرئي. يتضمن البحث تقنيات متقدمة لتحسين أداء النماذج دون الحاجة لتعديل كبير.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
