في عالم الذكاء الاصطناعي، يبدو أن التطورات التقنية تستمر في دفع الحدود نحو آفاق جديدة. ولعل أحدث هذه الابتكارات هو نموذج ST-OmniQA، الذي يقدم رؤية شاملة عن المصادر الصوتية الديناميكية. يتطلب الفهم الفعلي للأصوات الديناميكية تحديد مصدر الصوت، موقعه، وحركته على مر الزمن، ولكن النماذج الصوتية التقليدية غالبًا ما تقدم التسجيلات كأحداث صوتية إجمالية، في حين أن نماذج الرؤية تفتقر إلى الإشارات الصوتية التي تُساعد على تحديد مكان وتحديد الحركة الفردية لمصادر الصوت.

للتغلب على هذا القصور، طور الباحثون ST-OmniQA، وهو معيار جديد يركز على الإجابة عن الأسئلة المتعلقة بالصوت خلال الأحداث السمعية والبصرية. تم بناء هذا النموذج من مقاطع الفيديو البانورامية المصحوبة بتسجيلات صوتية من نوع Ambisonics من المصادر الصوتية المتحركة، حيث يحتوي على 40,000 فيديو و400,000 سؤال مقترن بأجوبة موزعة على أربعة مستويات معرفية تغطي التعرف على أحداث الصوت، اتجاه الوصول، مسافة المصدر، والمسارات الحركية.

للارتقاء بمستوى الأداء، تم تطوير نموذج ST-Omni-R1 الذي يدمج التمثيلات السمعية والحركية المستمدة من FOA مع السياق البصري البانورامي. يستخدم هذا النموذج أساليب التعلم التدريجي ومنهج التعزيز عبر شجرة reasoning، مما أدى إلى تحقيق دقة دلالية متوسطة قدرها 77.83% عبر المستويات الأربعة، مقارنة بـ37.28% لنموذج مرجعي آخر تم اختباره.

وأظهرت النتائج على ثلاثة معايير عامة للصوت المكاني أيضًا أن التمثيلات المكانية والحركية السابقة تتجاوز نطاق ST-OmniQA، مما يشير إلى إمكانيات هذا النموذج الثوري في مجالات الذكاء الاصطناعي.