شهدت تقنية ترجمة لغة الإشارة (Sign Language Translation) تقدمًا ملحوظًا thanks to deep learning، إلا أن تقييمات الأداء لا تزال تعتمد بشكل كبير على المترجمين. في دراسة جديدة نُشرت على منصة arXiv، تم تسليط الضوء على القضايا التي يسببها الاعتماد على المترجمين، حيث وجدت أن النماذج قد لا تعمم بشكل صحيح، بل تعتمد على انتظامات محددة لكل مترجم.
تضمنت الدراسة قيام الباحثين بإجراء تقييم باستخدام «التعاون بين المترجمين» على ثلاثة نماذج رائدة ومفتوحة المصدر: GFSLT-VLP، GASLT، وSignCL. تم استخدام مجموعتين من البيانات هما CSL-Daily وPHOENIX14T. أظهرت النتائج أن الأداء تحت التقييم المستقل عن المترجمين انخفض بشكل حاد. مثلاً، انخفض مؤشر BLEU-4 لنموذج GFSLT-VLP من 21.44 إلى 3.59، بينما انخفض ROUGE-L من 42.49 إلى 11.89.
كما لوحظ في مجموعة بيانات CSL-Daily أن العديد من الجمل المستهدفة تم تأديتها بواسطة عدة مترجمين، مما يعني أن تقسيمات البيانات الشائعة قد تضع جملًا متكررة في مجموعة التدريب والاختبار، مما يرفع معدل الدرجات بشكل غير عادل. هذه النتائج تشير إلى أن الاعتماد على تقييمات محددة بالمترجمين يمكن أن يبالغ بشكل كبير في تقدير قدرة نماذج ترجمة لغة الإشارة.
وبناءً عليه، أوصى الباحثون بعدة خطوات تعزز من دقة التقييم، منها:
1. اعتماد بروتوكولات مستقلة عن المترجمين لضمان تعميم النتائج على مترجمين غير مألوفين.
2. إعادة هيكلة مجموعات البيانات لتتضمن تقسيمات مستقلة وبدون تداخل بين الجمل لمعايير قياس دقيقة.
3. الإبلاغ عن النتائج المستقلة والتابعة للمترجمين مع مراعاة تداخل الجمل بين التدريب والاختبار لزيادة الشفافية والمقارنة.
هذا التطور قد يسهم في تحسين فهمنا لقدرات تقنية ترجمة لغة الإشارة، فهل تعتقدون أن هذه التوصيات ستحدث فرقًا في دقة التقييم؟ شاركونا آرائكم في التعليقات.
إعادة التفكير في ترجمة لغة الإشارة: تأثير اعتماد المترجم على تقييم النماذج
تتقدم ترجمة لغة الإشارة بفضل التعلم العميق، لكن لا تزال التقييمات تعتمد بشكل كبير على المترجمين، مما قد يثير تساؤلات حول مدى عمومية النماذج. دراسة جديدة توصي باتباع بروتوكولات مستقلة عن المترجم لتعزيز الشفافية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
