في عالم أنظمة الذكاء الاصطناعي المخصصة لتوليد الصور، تلعب مقاييس الجماليات (Aesthetic Scorers) دوراً حاسماً في تصفية بيانات التدريب وتوجيه عملية الإنتاج. ومع ذلك، يبقى السؤال حول ما إذا كانت هذه المقاييس تعكس سمات ديموغرافية (Demographic Attributes) الجودة الفعلية للناتج هنا مثيراً للجدل.

في دراسة جديدة، تم تدقيق أربعة مقاييس جمالية هي (LAION-Aesthetics)، و(PickScore)، و(ImageReward)، و(HPSv2) باستخدام تدخلات على مستوى البكسل (Pixel-Level Interventions) تتعلق بلون البشرة ونوع الجسم في الصور الحقيقية والمصطنعة.

**النتائج الرئيسية تشير إلى أن**:
1. **التفضيلات القائمة على الجودة:** بالنسبة للتأثيرات المتعلقة بلون البشرة، كانت النتيجة السائدة تفضيلات الجودة (Fidelity Preference). حيث سجلت الصور غير المعدلة أعلى الدرجات، وأي تغيير ناقص أو زائد تم فرض عقوبات (Inverted-U).
2. **نفس العقوبات تظل موجودة:** الأذرع الوهمية (Placebo Arms) أظهرت أن هذا العقاب ليس ناتجاً عن عملية التلاعب باللون الجلدي، لأن تطبيق نفس التحول على مناطق غير فموية أظهر عقوبات مشابهه.
3. **النتائج تتباين بين الصور الاصطناعية والحقيقية:** لذلك، لم تكن نتائج التدقيق على الصور الاصطناعية دقيقة. على سبيل المثال، أظهر مقياس (LAION-Aes) تفضيلات قوية للبشرات الداكنة في الصور الاصطناعية، لكنه تبدل في الصور الحقيقية التي تم تحليلها حيث تراجعت هذه التفضيلات بشكل كبير.

إجمالاً، تقدم الدراسة معايير قابلة للتكرار (Reproducible Benchmarking) مع التحكم في العوامل والاعتبارات المتقاطعة بين الصور الاصطناعية والحقيقية، مما يسلط الضوء على ضرورة التفاعل بين مجالات الجماليات والخصائص الديموغرافية. إن فهم كيف تؤثر تلك العوامل في الأنظمة يمكن أن يساعد في تمييز التحيزات الحقيقية من تفضيلات الجودة.

للخوض في هذا الموضوع المثير، كيف تعتقد أن أنظمة الذكاء الاصطناعي ستحسن من دقتها عند تقييم الصور المختلفة؟ شاركونا في التعليقات.