تعتبر نماذج الصوت واللغة الكبيرة (Large Audio-Language Models) من أبرز الابتكارات في مجال الذكاء الاصطناعي، إلا أن تكييفها لمهام معقدة مثل التعرف على عواطف الكلام (Speech Emotion Recognition) كان يمثل تحدياً كبيراً. في محاولة للتغلب على هذه العقبة، تم تقديم إطار عمل جديد يسمى HyPASE، الذي يستخدم الهندسة المفرطة لتحسين عملية التكييف.
تعتمد طريقة HyPASE على استخدام نموذج الكرة بوانكاريه (Poincare ball model)، حيث يمثل نصف القطر المفرط وكيلًا صريحًا لتنوع التمثيلات. الإطار يتألف من مكونين رئيسيين: المُكيف الهندسي المفرط (Hyperbolic Geometric Adapter) الذي يستخدم لتعديل الأوزان بمرونة، والمجمع العابر للوسائط القادر على استيعاب العواطف (Emotion-aware Multi-capacity Cross-modal Aggregator)، الذي يضغط الميزات متعددة المقاييس إلى بادئات صوتية مركزة.
تظهر النتائج التجريبية أن HyPASE يتفوق على الطرق التقليدية في استخدام الفضاء الإقليدي، محققًا تحسنًا ملحوظًا في دقة التعرف على العواطف على مجموعة بيانات MELD، بالإضافة إلى الفائدة في تصنيف العواطف غير المتوازنة. كما يتيح HyPASE إمكانية التعميم عبر مجموعات بيانات مختلفة بميزانية معلمات مقيدة.
مع تطور الإطار HyPASE، يتضح أنه يمثل خطوة هامة نحو تحسين النماذج الصوتية الكبيرة في مجال التعرف على العواطف، مما يعكس الحاجة المستمرة لتطوير تقنيات متقدمة في مجال الذكاء الاصطناعي.
ما رأيكم في هذه التقنيات الثورية؟ شاركونا في التعليقات!
استكشاف HyPASE: الإطار الثوري لتكييف عواطف الكلام لموديلات الصوت والبنية الجديدة!
قدمت دراسة جديدة إطار HyPASE الذي يعتمد على الهندسة التفاضلية لتحسين دقة تكييف عواطف الكلام. هذا الإطار يعد بفتح آفاق جديدة في استخدام نماذج الصوت الكبيرة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
