في عالم الترجمة، تكتسب النصوص الموجودة على الإنترنت أهمية متزايدة، حيث تحتوي هذه النصوص على علامات (Tags) تحمل معانٍ هيكلية ودلالية ووظيفية. ومع تقدم أنظمة الترجمة المدعومة بنماذج لغوية ضخمة (LLMs)، تواجه هذه الأنظمة تحدياً يتمثل في إيجاد التوازن بين سلاسة الترجمة وموثوقية العلامات عند معالجة النصوص المفعلة بها.

اليوم، نتناول نهجاً ثورياً يتضمن ثلاثة مستويات مترابطة: تكوين البيانات، بناء القدرات، ومحاذاة الأهداف المتعددة. في المستوى الأول، تم التعرف على تناقض أساسي بين تنوع العلامات الهيكلية وطبيعة الترجمة أثناء توليد البيانات الاصطناعية. حيث غالباً ما تستخدم الأساليب الحالية أحد الجانبين على حساب الآخر.

تم اقتراح استراتيجية تكوين هجينة (Hy-LST) تجمع بين أساليب التوليد المعتمدة على LLMs وطرق تكوين العلامات ثنائية المرحلة لضمان إنتاج بيانات مسماة متنوعة وطبيعية في آن واحد. تأتي خطوة بناء القدرات في المرتبة الثانية، حيث يتم تحليل الترجمة المدركة للعلامات في أربع مهام فرعية ضمن إطار تحسين متعدد المهام، مما يتيح الحصول على مهارات مستهدفة ونقل المعرفة.

ولتعزيز النتائج، تم تصميم ثلاث وظائف مكافأة تحت إطار تحسين سياسات نسبية جماعية، تستهدف كل واحدة منها هدفًا مختلفًا (الطلاقة، موثوقية العلامات، وجودة الترجمة المحدودة بالعلامات). وقد أظهرت التجارب على ستة اتجاهات لغوية (من الإنجليزية إلى الصينية واليابانية والألمانية والفرنسية والروسية) أن هذه المستويات تساهم في تحسينات قابلة للقياس.

أخيراً، تكشف التحليلات النوعية عن أنماط أخطاء محددة وكيف تم التخفيف من هذه الأخطاء بعد التدريب باستخدام الطريقة المقترحة، مما يعزز فعالية النظام الجديد. إذا كنت مهتمًا بالتطويرات في عالم الترجمة، فإن النتائج المبشرة لهذه الدراسة تستحق المتابعة.