في عالم يتزايد فيه استخدام نماذج الذكاء الاصطناعي لتوليد المحتويات البصرية مثل تحرير الوجوه وحماية الخصوصية، برزت الحاجة إلى مقاييس تشابه تعكس الإدراك البشري بصدق. ومع تقدم تقييم الإدراك من استخدام الأدوات الإعتمادية إلى النهج القائم على التمثيل، كانت المقاربات الحالية تفتقر إلى المحاذاة المعرفية. فبدلاً من أن تكون كصندوق أسود، اعتمدت هذه الدراسة على نتائج علم النفس الإدراكي لفهم كيفية إدراك البشر لتشابه الوجوه.

نقدم في هذا السياق مجموعة البيانات FACETS ونقترح ALIGNFACE، وهو مقياس يشبه الوجوه المعتمد على الإدراك البشري. يعتمد ALIGNFACE على النموذج التفسيري ويستخدم تقنيات متقدمة مثل نمذجة اللغة البصرية (Visual-Language Modeling) لاستخراج الخصائص والسمات من الصور، بالإضافة إلى استخدام نماذج التحليل الجيني المعمم (Neural Generalized Additive Model) لفهم التأثيرات غير الخطية.

أظهرت التجارب أن ALIGNFACE يعزز من دقة المحاذاة مع إدراك المجموعات البشرية المختلفة مقارنة بالمقاييس التقليدية. وهذا يمثل خطوة كبيرة نحو تقييم أكثر شفافية وفعالية للمحتوى البصري وفتح آفاق جديدة في فهم كيفية استجابة النماذج للمستخدمين المتنوعين.