في عالم الترجمة الآلية (Machine Translation)، غالبًا ما تُعتمد مقاييس قائمة على المراجع لتقييم جودة الترجمة. ومع ذلك، يُظهر البحث أن هذه الطرق قد لا تتوافق بشكل جيد مع تقييمات البشر. المشكلة تكمن في أن التقييم القائم على المراجع، رغم كونه النمط الشائع، لا يعكس تعريف adequacy عند تقييم الترجمة.

تعتبر المراجع تجسيدًا واحدًا فقط للمصدر، وقد تؤدي لاستدراج التحيز أو الأخطاء في التقييم. لذا، يجادل الباحثون بأن الحكم على adequacy يجب أن يكون مستندًا إلى المصدر، حيث إن إغفال المصدر في عملية التقييم يمكن أن يقلل من السلامة إلى مجرد تفضيل نحو المرجع.

علاوة على ذلك، يُظهر البحث أن المقاييس الهجينة المتاحة تعتمد بشدة على المراجع مقارنة بالمصدر، مما يجعل أي بروتوكول تقييم يتجاهل المصدر غير مكتمل هيكليًا. لذلك، يطالب الباحثون بإعادة صياغة قياسات جودة الترجمة (Quality Estimation) كنهج رئيسي بدلاً من أن تكون مجرد حل احتياطي عندما تكون المراجع مفقودة.

لذا، هل ستسهم هذه المناقشات في تحسين تقييم الترجمة وجعلها أكثر موضوعية؟

إنها دعوة للتركيز على المصداقية الأساسية في عملية التقييم، واستخدام المراجع كأدلة مكملة وليس كمعيار رئيسي.