مع التسارع الكبير في تطور أنظمة تحويل النصوص إلى صور (Text-to-Image، T2I)، أصبح من الضروري تقييم الأصالة الثقافية للمحتوى الم synthesized. حيث تعاني المقاييس التقليدية لتقييم T2I وأيضًا المحكمون متعدد الوسائط من عدم تمثيل المعايير الثقافية الضمنية بشكل كافٍ، مما يؤدي إلى تصورات متحيزة وإغفال الإشارات الثقافية الدقيقة.
لتجاوز هذه التحديات، قدم الباحثون نموذج مكافأة ثقافية ضمني يعتمد على نموذج لغوي متعدد الوسائط (Multimodal Large Language Model) يحتوي على 4.2 مليار معلمة. يدمج هذا النموذج بين مسبار ثقافي ضمني وآلية جذب الانتباه المتقاطعة ذات الاتصال المتجاوز (Skip-connection Cross-Attention)، مما يسمح للنماذج بتحسين التفاصيل الثقافية وضمان دقة أكبر في التقييم.
تمت الاختبارات باستخدام 3,323 زوجًا من الصور المختارة بعناية من مرجع CulturalFrames، والتي أظهرت أن النموذج المُقترح حقق دقة 80.54%، مع معاملات ارتباط Pearson وKendall تبلغ 0.546 و0.377 على التوالي، متفوقًا بذلك على المقاييس التقليدية. كما أنه يعالج كل تقييم في خلال 0.21 ثانية، مما يعني تسريعًا بواقع 10 مرات مقارنةً بالمقيمين التقليديين.
تقدم هذه النتائج دليلاً على أن النموذج المقترح يمكن أن يوفر إشارات مكافأة فعالة وواعية ثقافيًا تسهم في تحسين نماذج التفضيل في سياقات التعلم المعزز من ردود فعل البشر وتحسين التفضيلات بشكل مباشر.
ثورة في تقييم الصور الناتجة عن النصوص: نموذج مكافأة ثقافية مبتكر
مع تقدم أنظمة تحويل النصوص إلى صور (T2I)، أصبح تقييم الأصالة الثقافية للمحتوى الم synthesized أمرًا حيويًا. نقدم نموذج مكافأة ثقافية ضمني يسهم في تحسين دقة التقييم الثقافي وتعزيز التجربة التفاعلية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
