في عالم الذكاء الاصطناعي، جرى تطوير العديد من النماذج متعددة الأنماط (Multimodal Models) التي تحقق نتائج قريبة من الكمال في تعريف الأطعمة. ولكن، هل تعكس هذه النتائج فهماً ثقافياً حقيقياً أم أنها مجرد مطابقة بصرية؟ للإجابة عن هذا السؤال، تم تقديم "CulturalMenuBench"، معيار فريد يحتوي على 4870 عنصراً موزعاً على 10 لغات و18 منطقة.
يتضمن هذا المعيار 10 مهام تربط بين صور الأطباق النهائية، صور خطوات الطهي، المكونات، النصوص الإجرائية، والعناوين الإقليمية، ويتراوح من التعرف الأساسي إلى إسناد ثقافي معتمد على العمليات.
عند تقييم 12 نموذجاً، تكشفت فجوة كبيرة في المعرفة والتطبيق: حيث حققت النماذج أكثر من 94% في مهام الاختيار المتعدد القياسية، لكنها تراجعت إلى 56% عند إسناد الأطباق إلى المطابخ الإقليمية الصينية، رغم استخدام نفس صيغة الأسئلة.
تظهر التحليلات التشخيصية أن أنماط الأخطاء تتوافق مع التخمين العشوائي، بينما دقة التعرف ترتبط بشكل أكبر بالتمييز البصري بدلاً من الهيكل الثقافي. والأكثر إثارة للدهشة هو أن النماذج تحقق تصنيفات دقيقة للمطابخ عند استخدام أسماء الأطباق فقط، بفارق يتراوح بين 7 إلى 18 نقطة.
هذا يعني أن المعرفة موجودة لكن لا يمكن تنشيطها من خلال المدخلات البصرية. يؤكد هذا البحث أن إزالة صور خطوات الطهي تؤثر بشكل انتقائي على المهام المعتمدة على العمليات، مما يشير إلى أن الربط بين الإدراك، العملية، والسياق الثقافي مطلوب.
المعلومات والبيانات المتعلقة بتجربة "CulturalMenuBench" متاحة للجمهور، مما يفتح المجال أمام المزيد من الأبحاث في هذا المجال.
اكتشاف الفجوة الثقافية في النماذج متعددة الأنماط: CulturalMenuBench في ساحة الطهي
قامت دراسة جديدة بتقديم CulturalMenuBench، معيار مبتكر يمزج بين التعرف على الأطعمة والفهم الثقافي. النتائج تشير إلى وجود فجوة كبيرة بين المعرفة والتطبيق الثقافي في النماذج اللغوية متعددة الأنماط.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←# CulturalMenuBench# Multimodal Models# Culinary Reasoning# Knowledge Application# Cultural Understanding
جاري تحميل التفاعلات...
