في خطوة رائدة نحو تطوير نماذج اللغة الصوتية (Audio Language Models)، تم الإعلان عن HEAR، وهو معيار عالمي يتألف من 87 ألف عينة صوتية حقيقية مسجلة من 843 مشاركًا مختلفًا عرقيًا. يتيح هذا المعايير تقييمًا شاملاً عبر أسئلة متعددة الخيارات (MCQA) ومهام مفتوحة طويلة الأمد. يُعتبر HEAR الأول من نوعه الذي يعتمد بالكامل على الكلام البشري الأصلي، مما يعزز دقة التقييمات.

يتعمق HEAR في تحليل سلوك النماذج عبر أنظمة تحويل الكلام إلى كلام (speech-to-speech) وتحويل الكلام إلى نص (speech-to-text). تكشف النتائج أن التحيز المعتمد على الصوت هو خاصية نموذجية ويمكن التحكم فيها، مما يُظهر فرصة واضحة لتحسين أداء النماذج. كما تشير النتائج إلى أن التعليمات المخصصة للمستخدمين تُؤدي إلى تفاقم الفروقات العرقية.

بهذه الطريقة، يُوفر HEAR إطار عمل أساسي للحد من التحيزات وتقييمها في تطوير نماذج اللغة الصوتية، مما يفتح أفقًا جديدًا للباحثين والمطورين في مجال الذكاء الاصطناعي.