تعتبر التقييمات البشرية معيار الذهب في تقييم أنظمة توليد اللغة الطبيعية (NLG)؛ حيث تعتمد العملية التقليدية على جمع التقييمات للنصوص المولدة، وجمع متوسط التقييمات من مختلف المقيّمين، وتصنيف الأنظمة بناءً على تلك النقاط. ومع ذلك، لا يُعطى الكثير من الاهتمام لطبيعة تلك التقييمات وما إذا كانت تستوفي فعليًا تفضيلات البشر. من خلال تحليل هذا البروتوكول القياسي في إطار نظرية المنفعة في الاقتصاد، قمنا بتحديد فرضيات ضمنية تتعلق بالمقيّمين، وغالبًا ما تُنتهك هذه الفرضيات في الممارسة العملية، مما يؤدي إلى أن تصبح التقييمات غير تعكس تفضيلات المقيّمين.

تعد الانتهاكات الأكثر وضوحًا ناتجة عن استخدام مقاييس ليكرت (Likert scales)، التي يمكن أن تعكس الاتجاه الحقيقي للتفضيل في بعض الحالات. لذلك، نقترح تحسينات على البروتوكول القياسي لجعله أكثر دقة من الناحية النظرية، ولكن حتى في صورته المحسنة، يبقى غير المناسب لتقييم المهام المفتوحة مثل توليد القصص.

لهذا الغرض، نقدم بروتوكول تقييم بشري جديد يُعرف باسم "التقييم الاحتمالي على مستوى النظام" (System-Level Probabilistic Assessment) والذي يسمح لنا باستعادة ترتيب نماذج GPT-3 بناءً على الحجم مع نتائج ذات دلالة إحصائية. بينما عند تقييم القصص باستخدام البروتوكول القياسي، لا يمكن استعادة أقل من نصف التفضيلات المتوقعة، مما يشير إلى عدم وجود اختلاف ملحوظ بين "كورى" (curie) و"دافنشي" (davinci) على الرغم من استخدام اختبار محسّن.

هل أنتم متفاجئون من النتائج؟ كيف ترون أهمية استخدام بروتوكولات تقييم أكثر دقة في الذكاء الاصطناعي؟ شاركونا آرائكم في التعليقات!