في عالم يشهد انتشارًا متزايدًا لتكنولوجيا الذكاء الاصطناعي، تظهر نماذج الرؤية واللغة (Vision-Language Models) ككيان مُهيمن في اتخاذ القرارات المرتبطة باختيار الصور. حيث يتمسك العديد من المطورين بفكرة أن هذه النماذج، التي تمتلك ملايين التفاعلات والمعايير، هي بمثابة حكام يقررون ما يجب أن يراه المستخدمون.

أحدث دراسة تناقش هذا الموضوع تأتي من arXiv، حيث قام الباحثون بتدقيق هذه النماذج عن طريق تقييم أدائها في اختيار الصور المرتبطة بمقاطع ثقافية معينة. استخدم الباحثون مجموعة من 300 مقترح ثقافي، وعكفوا على مقارنة الصور التي اختارتها النماذج بتقييمات بشرية لم تتوفر للنموذج، وكذلك مع اختيارات عشوائية من نفس المجموعة.

والملفت للنظر هو أن نموذجًا يحتوي على 4 مليار معلمة لم يتفوق إلا قليلاً على الخيارات العشوائية، بل وسقط تحت عتبة التشابه مع نموذج CLIP. أظهرت النتائج أن هذا النموذج اختار الصورة الأولى في 49% من الحالات، وهو ما يعد نسبة مرتفعة بشكل مدهش، إذ إن الإعادة الترتيبية للصور غيرت اختيارات النموذج في 60% من الحالات.

في المقابل، كان نموذج 8 مليار معلمة أكثر توازنًا حيث أظهر قدرة على تجاوز تحيز الموقع، لكن المرشحات المستخدمة كانت في كثير من الأحيان تتجاهل قرارات جيدة. في حين أن الاتفاق بين اختيارات النموذج والحكم البشري كان مفيدًا في بعض الحالات، يجب إعادة تدقيق هذه المرشحات كلما تغيرت أحكام النموذج. تُظهر هذه النتائج أهمية الفهم العميق لكيفية عمل هذه النماذج وتأثيرها على الروايات الثقافية التي تقدمها للمستخدمين.

في النهاية، سيثير هذا البحث تساؤلات حول مستقبل الاعتماد على الذكاء الاصطناعي كحكام في اتخاذ القرارات، خصوصاً عندما يتعلق الأمر بالمحتوى الذي يتناوله المجتمع.