في عالم يتطور بسرعة، تبرز نماذج اللغات الكبيرة متعددة الوسائط (Multimodal Large Language Models - MLLMs) كأحد الأدوات القوية التي تدفع بمجالات متعددة. ومع ذلك، فإن المعايير الحالية لتقييم هذه النماذج تركز بشكل كبير على المعرفة العامة والمنطق الخطّي المعروف في تخصصات العلوم والتكنولوجيا والهندسة والرياضيات (STEM)، مما يتجاهل احتياجات العلوم الإنسانية والاجتماعية (Humanities and Social Sciences - HSS) الفريدة.
تتطلب المهام في مجال العلوم الإنسانية والاجتماعية تفكيرًا أفقياً ودمجاً عميقاً للمعرفة، وهو ما يمثل تحديات خاصة لنماذج MLLMs، وخاصة في ربط المفاهيم المجردة بالتمثيلات البصرية المناسبة. لتسليط الضوء على هذه الفجوة، تم تقديم HSSBench، وهو معيار مخصص يهدف إلى تقييم قدرات MLLMs في مهام العلوم الإنسانية والاجتماعية بعدة لغات، بما في ذلك اللغات الست الرسمية للأمم المتحدة.
من خلال تقديم خط أنابيب جديد لتوليد البيانات المصممة خصيصًا لسيناريوهات العلوم الإنسانية والاجتماعية، يتيح HSSBench التعاون بين الخبراء في المجال والوكلاء الآليين لتوليد وتنقيح كل عينة بشكل دوري. يحتوي HSSBench على أكثر من 13,000 عينة مصممة بعناية، تغطي ست فئات رئيسية.
لقد قمنا باختبار أكثر من 20 نموذجاً شائعًا من MLLMs باستخدام HSSBench، وأظهرنا أن هذا المعيار يشكل تحدياً كبيراً حتى لأحدث النماذج. نأمل أن يلهم هذا المعيار مزيدًا من الأبحاث لتعزيز قدرات التفكير بين التخصصات لدى MLLMs، خاصة في قدرتها على استيعاب وربط المعرفة عبر مجالات مختلفة.
HSSBench: ثورة جديدة في تقييم نماذج اللغات متعددة الوسائط في العلوم الإنسانية والاجتماعية!
تم إطلاق HSSBench كمعيار جديد يقيس قدرات نماذج اللغات الكبيرة في العلوم الإنسانية والاجتماعية، مما يفتح آفاقًا جديدة لاستخدام هذه النماذج. هذا الإنجاز يسهم في تحقيق تواصل أفضل بين المعرفة النظرية والتمثيلات البصرية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
