في عالم الذكاء الاصطناعي الذي يمضي سريعاً نحو المستقبل، يأتي إطلاق معيار BEAR-Bench (Bilingual Enterprise and Academic Reasoning) كخطوة ثورية في تقييم نماذج اللغة متعددة الوسائط (Multimodal Large Language Models - MLLMs). بينما حققت هذه النماذج إنجازات ملحوظة في فهم الصور، إلا أن تقييم أدائها في معالجة الوثائق النصية الغنية بالتفاصيل لا يزال غير مكتمل.

يعتمد معيار BEAR-Bench على 1000 سؤال تمت مراجعته من قبل البشر، ويهدف إلى تقديم تقييم شامل للنماذج في مجالات الأعمال والعلوم. وقد أُخذت بعين الاعتبار اللغتين الإنجليزية والروسية، مما يعالج الفجوة القائمة التي تترك بعض اللغات الأخرى تحت التمثيل.

تم اختبار 16 نموذجاً من نماذج MLLMs، بما في ذلك Gemini 3.1 Pro و Qwen3.5-397B، لتحديد مدى قدرتها على معالجة الأسئلة المطروحة ضمن BEAR-Bench. وتظهر النتائج أن النماذج، حتى الأقوى منها، لا تزال لديها مجالات تحتاج إلى تحسين.

كما تم استخدام نتائج هذه النماذج للمقارنة بين منهجيات كشف الهلاوس، مما يتيح تحديد مدى فشل النماذج في BEAR-Bench ومدى موثوقية الكشف عن هذه الفشل.

تعتبر هذه التطورات خطوة هامة نحو تحسين آليات معالجة المعرفة في النماذج متعددة الخدمات، وتوسيع خبراتها عبر لغات وثقافات متعددة. هل أنتم مستعدون لاستكشاف الإمكانيات المقبلة لهذا المعيار الثوري؟