تعتبر تقنية إنتاج الوجوه الرقمية المتحركة التي تعتمد على الصوت أحد الفعاليات الهامة في مجالات التواصل الافتراضي والتفاعل التفاعلي وإنتاج وسائل الإعلام. مع تقدم تقنيات حقل الإشعاع العصبي (Neural Radiance Fields - NeRF) وتقنية 3D Gaussian Splatting، حققت الأنظمة التفاعلية للوجه نتائج أكثر دقة في نمذجة شكل الوجه الثلاثي الأبعاد والمظهر.
تتمثل المشكلة الأساسية في أن ميزات الكلام تصف غالبًا الأنماط الصوتية الزمنية بدلًا من التوزيعات الواضحة للوجه، مما قد يؤدي إلى غير دقة في حركة الفم وتفاصيل التعبير. لمعالجة هذه التحديات، تم اقتراح إضافة وحدة تعزيز مكاني قائمة على معالم الوجه. تقدم المعالم المتوقعة إشارات هيكلية تساعد في تحديد وتعزيز النقاط المكانية حول المناطق الحساسة للتعبير.
علاوة على ذلك، تم تقديم آلية تعويض عالمية للمعالم، حيث يتم ترميز مجموعة كاملة من النقاط الرئيسية في متجه شرطية لتحسين سمات 3D Gaussian Splatting. هذه التعويضات تزود تمثيل الشكل الأساسي بمعلومات هيكلية كاملة عن الوجه.
أظهرت التجارب التي أجريت في ظل بيئات مدفوعة ذاتيًا وأخرى مدفوعة عرض النطاق العريض أن الطريقة المقترحة عززت من جودة الصورة، والواقعية الوجهية، وتزامن حركة الشفاه، مما يبشر بعصر جديد من التواصل الافتراضي المعزز بالذكاء الاصطناعي.
اكتشاف تقنية جديدة لإنتاج الوجوه الرقمية بدقة مذهلة باستخدام الذكاء الاصطناعي!
تقدم التقنية الجديدة التي تعتمد على حقل الإشعاع العصبي (NeRF) وتقنية 3D Gaussian Splatting إمكانية إنشاء وجوه رقمية واقعية تدعم تفاعل المستخدم بشكل مدهش. من خلال تحسين نقاط الوجه، يتم تحقيق تعبيرات مذهلة وتزامن حركي دقيق.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
