على الرغم من التقدم المذهل الذي شهدته نماذج الذكاء الاصطناعي التوليدية (Generative Models) خلال العقد الماضي، لا تزال المخاوف بشأن عدم عدالة تلك النماذج قائمة. إذ تُظهر الدراسات أن هذه النماذج قد تعزز من الفوارق الاجتماعية وتلحق الأذى بالفئات المهمشة. في ورقة موقف حديثة، تم طرح حجج قوية تشير إلى أن فشل العدالة في هذه النماذج يعود إلى مشكلة في التقييم: حيث نجد أن نتاجات العدالة نادرًا ما تكون قابلة للمقارنة بين الأوراق البحثية أو قابلة للتطبيق في قرارات التنفيذ.

تناقش الورقة كيفية وجود أنماط متكررة من الفشل التجريبي والمفاهيمي في الممارسات الحالية، مما يحتم التحول من الفحوص العشوائية للأخطاء إلى تقييم موحد ومتخصص لنماذج الذكاء الاصطناعي التوليدية. من أبرز الاقتراحات هو استخدام بطاقات العدالة (Fairness Cards)، وهي أداة تقريرية تهدف إلى جعل خيارات التقييم واضحة (مثل مجموعات المحفزات، بروتوكولات التعاكس، المقاييس، وإدارة الرفض). هذه البطاقات تهدف إلى تعزيز القابلية للتكرار، والمقارنة، والمساءلة.

ختامًا، تبرز الورقة الحاجة لإعادة التفكير في معايير التقييم الحالية لخلق تحول جذري في هذا المجال الحيوي. هل حان الوقت لنتبنى أساليب جديدة تسعى لتحقيق العدالة في الذكاء الاصطناعي؟ لنشارك أرائنا حول هذا الموضوع في التعليقات.