في ظل الانتشار الواسع لنماذج الفيديو اللغوية (Video Large Language Models) حول العالم، يكتسب تقييم قدرتها على التفكير عبر السياقات الثقافية أهمية متزايدة. وبهدف تعزيز تقييم الوعي بالمعايير الثقافية في هذه النماذج، يقدم الباحثون مشروع VideoNorms، والذي يتضمن مجموعة بيانات غنية تحتوي على تعليقات حول المعايير الثقافية مستخلصة من برامج تلفزيونية شهيرة في كل من الولايات المتحدة والصين.
تتضمن هذه البيانات تقييمات توضح مدى الالتزام أو الانتهاك للمعايير الثقافية، مدعومة بأدلة (لفظية وغير لفظية). عبر إطار تعاون بين الإنسان والذكاء الاصطناعي، تم أولاً تقييم كل عنصر بواسطة نموذج فيديو لغوي كبير، قبل عرضه على مجموعة من ثلاثة مقيمين بشريين على الأقل، يتمتعون بخبرة عميقة في الثقافة المستهدفة. وأسفر ذلك عن الحصول على مجموعة بيانات تضم أكثر من 3000 حكم بشري.
أظهرت المراجعة البشرية تباينًا في أداء استخراج المعايير الثقافية بين النماذج في الولايات المتحدة والصين، مما يسلط الضوء على المخاطر المرتبطة بالاعتماد الكامل على الأساليب الأوتوماتيكية، خصوصًا مع الثقافات التي لم يتم تمثيلها بشكل كافٍ في بيانات التدريب.
تحليلات النموذج الهيراركي الخطي لأداء سبعة نماذج من VideoLLMs أظهرت عدة نتائج مثيرة:
1) الأداء كان أقل في السياق الصيني مقارنة بالأمريكي، خاصة في توقع الالتزام بالمعايير؛
2) واجهت النماذج صعوبة أكبر في تقديم أدلة غير لفظية مقارنة بالأدلة اللفظية لتوقعات الالتزام/الانتهاك للمعايير.
كدليل على الحاجة لوجود نماذج موجهة نحو الفيديو، أكدت الدراسات الاستبعادية أن استخدام الوسائط المرئية ضروري للأداء الدقيق، في حين لم تؤدي زيادة حجم النموذج إلى تحسين درجات التصنيف. تسهم نتائجنا والبيانات المجمعة في تدريب وتقييم نماذج الفيديو المتجذرة ثقافيًا، مما يمهد الطريق لتحسين الفهم الثقافي في نماذج الذكاء الاصطناعي مستقبلًا.
عدادات ثقافية جديدة تُعيد تشكيل فهم نماذج الفيديو: تعرف على VideoNorms!
يقدم مشروع VideoNorms قاعدة بيانات مبتكرة لتقييم الوعي الثقافي في نماذج الفيديو اللغوية. الدراسات تكشف عن تحديات كبيرة تواجه هذه النماذج في فهم القيم الثقافية بين الولايات المتحدة والصين.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
