في عالم الذكاء الاصطناعي، ظهرت تقنيات جديدة تعيد تعريف كيفية تعلم الأنظمة وتعاملها مع البيانات المتعددة الوسائط. من بين هذه الابتكارات، نبرز AV-JEPA، وهي نموذج مذهل يستند إلى تطوير LeJEPA، حيث يتم التركيز على التعلم الذاتي الصوتي والمرئي.
يستفيد AV-JEPA من تقنية *Vision Transformer*، ويستخدم أسلوب التصنيف المبكر مع تقنيات مثل *modality dropout*. تتيح هذه التقنيات للنموذج تدريبًا فعالًا يمكنه من محاذاة التضمينات من وجهات نظر محلية وعالمية، مما يعزز من توافق البيانات الصوتية والمرئية في فضاء خفي. تُعد وظيفة SIGReg جزءًا أساسيًا من هذا النموذج، حيث تشجع على الوصول إلى توزيع مثالي من الناحية النظرية.
ونتيجة لذلك، يتميز التصميم النظيف لهذا النموذج بعدم اعتماده على المُفكك (decoder) أو معلم بيئي (EMA teacher)، مما يجعله بسيطًا وفعالًا. وقد أثبت AV-JEPA تفوقه في الأداء من خلال تحقيق معدل دقة تبلغ 57.1% على مجموعة بيانات VGGSound و32.7 mAP على مجموعة AudioSet. بالإضافة إلى ذلك، يوفر النموذج إمكانية الاسترجاع الصوتي والمرئي دون الحاجة إلى تدريب مسبق.
إذا كنت متحمسًا لمتابعة أحدث الابتكارات في عالم الذكاء الاصطناعي، فلا تفوت فرصة استكشاف AV-JEPA وكيف يمكن أن يؤثر على مستقبل التعلم الذاتي.
تعرف على AV-JEPA: نظام متقدم للتعلم الذاتي الصوتي والمرئي يعيد تعريف الذكاء الاصطناعي!
تقدم AV-JEPA نموذجًا متعدد الوسائط يمزج بين التعلم الذاتي للصوت والصورة، محققًا أداءً متميزًا في التصنيف. تعرف على كيفية قيامه بتحقيق توافق متعدد الوسائط واستعراض أدائه المبهر.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
