في عالم الذكاء الاصطناعي، تعد مهارة فهم الأصوات الفضائية من المهارات الأساسية التي تساعد البشر على التفاعل مع البيئة المحيطة. واليوم، نعلن عن تقنية BAT، التي تمثل نقطة تحول في هذا المجال. BAT يجمع بين قدرة نموذج تحليل المشهد الصوتي ثنائي الأبعاد وبين إمكانيات التفكير اللغوي لنموذج لغوي ضخم (Large Language Model) من أجل محاكاة قدرة البشر الفطرية على فهم الأصوات.
للتغلب على نقص بيانات الصوتيات الفضائية المتاحة، قمنا بتطوير مجموعة بيانات صوتية ثنائية الأبعاد باستخدام AudioSet وSoundSpaces 2.0، حيث تم تصميم هذه البيانات لتكون متاحة للاستخدام العملي. كما طورنا أيضاً مجموعة بيانات SpatialSoundQA، التي تشمل مجموعة متنوعة من المهام المرتبطة بالأسئلة والأجوبة، مما يساعد في تدريب BAT على فهم وتجربة الصوتيات الفضائية.
تتضمن التكنولوجيا أيضاً مشفّر صوتي جديد يدعى Spatial Audio Spectrogram Transformer (Spatial-AST)، الذي يحقق نتائج قوية في الكشف عن أحداث الصوت، وتحديد الموقع، وتقدير المسافات.
عند دمج Spatial-AST مع نموذج LLaMA-2 7B، تتخطى BAT المهام التقليدية القائمة على تحديد مواقع الأصوات، مما يتيح لها التفكير في العلاقات بين الأصوات في البيئة المحيطة بها. تظهر تجاربنا كيف تفوقت BAT في مجالات إدراك الصوت وتجهيز المعلومات، مما يبرز الإمكانات الهائلة لنماذج اللغة الكبيرة في فهم وتفسير بيئات الصوت الفضائية المعقدة. هل أنتم متشوقون لاكتشاف المزيد عن هذه التكنولوجيا الثورية؟
BAT: تكنولوجيا جديدة في فهم الأصوات الفضائية باستخدام نماذج لغوية ضخمة!
تقدم BAT مزيجاً مذهلاً بين تحليل الصوتيات الفضائية وإمكانات التفكير اللغوي، مما يعزز قدرة نماذج الذكاء الاصطناعي على فهم البيئة المحيطة. اكتشفوا كيف يمكن لهذه التكنولوجيا أن تغير مفهومنا عن الصوت!
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
