في عالم الذكاء الاصطناعي (Artificial Intelligenceتواصل نماذج اللغات الضخمة (Large Language Models) إحداث ثورة في كيفية فهمنا وتفسير اللغات، بما في ذلك التاريخية منها. لكن، كيف يتم تقييم هذه الترجمات؟ في دراسة جديدة على منصة arXiv، تم تسليط الضوء على التحديات التي تواجهها هذه المعايير فيما يتعلق بترجمات الصينية الكلاسيكية إلى الإنجليزية.

تؤكد الدراسة أن استخدام المعايير التلقائية التقليدية، الموجودة في معظم أدوات الترجمة الحديثة، قد لا يكون فعالاً في السياقات اللغوية التاريخية. حيث ابتُكرت هذه المعايير مع الأخذ بعين الاعتبار اللغات الحديثة، مما يجعل تطبيقها في اللغة الكلاسيكية عرضة للمشاكل.

تم تطوير إطار تشخيصي يعتمد على أزواج الحد الأدنى (Minimal Pairs) التي تلتقط أنواع الأخطاء المهمة في السياقات الأكاديمية. تضمنت الدراسة فحص معايير تقييم مختلفة، سواء كانت مبنية على المراجع أو خالية منها، لقياس حساسية الأخطاء والتحمل للاختلافات المسموح بها.

كانت النتيجة واضحة: جميع المعايير لديها نقاط عمياء، ولكن كانت MetricX24 هي الأكثر أداءً بين الخيارات المطروحة.

تشير النتائج إلى ضرورة تطوير معايير تقييم أكثر دقة وقابلية للتفسير، تتناسب مع الخصوصيات التاريخية والثقافية للغات المترجمة. هذا ينبهنا إلى كيف يمكن للتقنية، رغم تقدمها، أن تحتاج دائمًا إلى تحسينات مستمرة لتحقيق نتائج مرضية.

ما رأيكم في هذه التحديات التي تواجه تقييم الترجمات التاريخية؟ شاركونا أفكاركم وتجاربكم في التعليقات!