في خطوة رائدة نحو تطوير نماذج اللغة الصوتية (Audio Language Models)، تم الإعلان عن HEAR، وهو معيار عالمي يتألف من 87 ألف عينة صوتية حقيقية مسجلة من 843 مشاركًا مختلفًا عرقيًا. يتيح هذا المعايير تقييمًا شاملاً عبر أسئلة متعددة الخيارات (MCQA) ومهام مفتوحة طويلة الأمد. يُعتبر HEAR الأول من نوعه الذي يعتمد بالكامل على الكلام البشري الأصلي، مما يعزز دقة التقييمات.
يتعمق HEAR في تحليل سلوك النماذج عبر أنظمة تحويل الكلام إلى كلام (speech-to-speech) وتحويل الكلام إلى نص (speech-to-text). تكشف النتائج أن التحيز المعتمد على الصوت هو خاصية نموذجية ويمكن التحكم فيها، مما يُظهر فرصة واضحة لتحسين أداء النماذج. كما تشير النتائج إلى أن التعليمات المخصصة للمستخدمين تُؤدي إلى تفاقم الفروقات العرقية.
بهذه الطريقة، يُوفر HEAR إطار عمل أساسي للحد من التحيزات وتقييمها في تطوير نماذج اللغة الصوتية، مما يفتح أفقًا جديدًا للباحثين والمطورين في مجال الذكاء الاصطناعي.
هل تعاني نماذج الصوت من تحيزات؟ تعرف على HEAR: أول معيار عالمي سجلته أصوات بشرية!
تم إطلاق HEAR، معيار مبتكر يهدف إلى تقييم تحيزات نماذج اللغة الصوتية باستخدام 87 ألف عينة صوتية حقيقية. النتائج تشير إلى أن التحيز يتعلق بنموذج معين وقابل للتحكم، مما يمهد الطريق لتحسينات مستقبلية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
