في عالم يتجاوز فيه الذكاء الاصطناعي (AI) الحدود الثقافية، تظهر الحاجة الملحة لتطوير أنظمة قادرة على تلبية احتياجات مجتمعات متنوعة ثقافيًا. عانت الأنظمة السابقة على مدار السنوات من الفشل في فهم المعايير الفريدة لكل ثقافة، حيث كانت معظم الدراسات تركز فقط على النصوص أو التعرف على العناصر البصرية مثل الطعام والملابس.
تقدم NormViz اليوم معيارًا جديدًا يطلق عليه NormViz-Bench، وهو إطار عمل يتكون من 3,268 صورة متباينة (6,536 صورة إجمالاً) تغطي 16 دولة. يعكس هذا المعيار السلوكيات الثقافية المختلفة، حيث يتعين على الأنظمة تصنيف كل صورة بناءً على مطابقتها أو انتهاكها للمعايير الاجتماعية المحلية.
تم تصنيف كل زوج من الصور وفقًا لسلوك ثقافي معين، مما يعني أن المقياس يعتمد على القدرة على التعرف وإدراك الفروق الدقيقة في السلوكيات البصرية. تُظهر الدراسات أن أقوى نماذج اللغات البصرية (VLMs) حاليًا مثل Gemini 3.0 Flash وQwen2.5 VL 7B حققت فقط نتائج 26.6% و21.6% على التوالي في تصنيف هذه الصور، ما يُظهر ضعفها في التعرف على السلوكيات الثقافية الدقيقة.
للتحسين من هذا الأداء، قدمت NormViz أيضًا مجموعة بيانات تدريبية جديدة تُدعى NormViz-Train، تحتوي على 64,000 صورة مرتبطة بشرح دقيق. وعلى الرغم من أن الأداء المطلق لا يزال منخفضًا (<30%)، أظهر التحسين في دقة التصنيف باستخدام NormViz-Train تحسنًا ملحوظًا يصل إلى 125% في دقة الأزواج، مما يفتح الطريق لتعليم الأنظمة ربط الإدراك البصري بالأهمية الثقافية.
تمثل المبادرتان NormViz-Bench وNormViz-Train تقدمًا مبتكرًا في فهم المعايير البصرية، وتحديات جديدة لمجال الذكاء الاصطناعي متعدد الأنماط. فهل يصبح فهم الثقافات المختلفة جزءًا أساسيًا في تطوير الذكاء الاصطناعي؟ هذا ما سنراه في المستقبل.
نحو فهم المعايير البصرية: NormViz تطلق معيارًا جديدًا لتحديات الذكاء الاصطناعي متعدد الأنماط
أعلنت NormViz عن إطلاق معيار جديد يهدف إلى تحسين قدرة أنظمة الذكاء الاصطناعي على فهم الثقافة المتنوعة عالميًا. يركز المعيار على تحليل سلوكيات بصرية وفقًا للمعايير الاجتماعية المحلية، مما يفتح آفاق جديدة في الذكاء الاصطناعي متعدد الأنماط.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
