في خطوة رائدة نحو تحسين تجربة التواصل للأفراد ذوي الإعاقات السمعية، تم تقديم إطار عمل جديد يعتمد على تقنيات الذكاء الاصطناعي لتوليد فيديوهات بلغة الإشارة. تستخدم هذه التقنية المتطورة شبكة Generative Adversarial Network (GAN) متعددة الخبراء، التي تتميز بكفاءة عالية في تحديد السمات البصرية المختلفة.
تقوم هذه الشبكة بتوجيه ثلاثة مميزين متخصصين - عالمي، يدوي، ورأسي - بحيث يقود كل منها فرع خبرة محدد في مولد الفيديو نحو منطقة بصرية معينة. هذا التخصص الضمني يسمح بتحقيق تنوع بصري دون الحاجة إلى خسائر تنوع صريحة.
ولتحقيق الاستقرار في هذا النظام الذي يحتوى على عدة مميزين، تم تقديم آلية توافق تحمل اسم United Loss، تعمل على تنظيم توجيه كل مميز نحو المتوسط الجماعي بوزن 10%. كما تتبنى كل فرع تصميم مسار مزدوج يجمع بين التلافيف (Convolutional) والمحول (Transformer) مع دمج ميزات قابلة للتكيف، مما يوازن بين استقرار التلافيف وتفاصيل الانتباه الذاتي.
تم تدريب المولد باستخدام جدول زمني ثلاثي متناوب يتضمن تعزيز المميز، التوليد الشامل، وتوليد الفرع المتخصص. وقد أظهرت النتائج ان النسخة ذات 0.2 مليار مرجع حققت نسبة PSNR تصل إلى 29.8، بينما وصلت النسخة ذات 1.3 مليار مرجع إلى 30.7.
تتيح هذه التقنية إمكانية الاستخدام على الأجهزة العادية، حيث تتطلب الذاكرة VRAM 1.5 جيجابايت و8 جيجابايت على التوالي.
تم عرض هذا النظام المبتكر خلال قمة التكنولوجيا الحدودية في هونغ كونغ لعام 2025، ويستمر العمل على دراسات شاملة لتقييم فعاليته في سياقات متنوعة. هل تعتقد أن هذه التكنولوجيا ستحدث تغييراً في حياة الأشخاص ذوي الإعاقات السمعية؟ شاركونا آراءكم في التعليقات!
إبداعات الذكاء الاصطناعي: توليد فيديوهات بلغة الإشارة باستخدام شبكات GAN متعددة الخبراء!
يقدم هذا التقرير الإبداعي إطاراً مبتكراً لتوليد فيديوهات بلغة الإشارة عبر استخدام شبكات GAN متعددة الخبراء. بفضل هذه التقنية، يمكن تحسين التواصل للأشخاص ذوي ضعف السمع بشكل كبير.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
