في خطوة غير مسبوقة، تم تقديم نموذج MameLoshnLM المبني على 8 مليار معامل، ليكون الأول من نوعه الذي يركز بشكل خاص على اللغة اليديشية. تبدو اليديشية، على الرغم من غناها التراثي المكتوب، ضئيلة الحضور في العالم الرقمي مما أبطأ تطور نماذج لغوية فعالة لها.

تأتي هذه المبادرة كحل لمشكلات الاعتماد على مجموعات بيانات متعددة اللغات، التي غالباً ما تحتوي على نصوص مشوشة، مترجمة آلياً، ومفصولة بشكل خاطئ، مما يؤدي إلى عدم دقة في النماذج المستخدمة للغة.

لملء هذه الفجوات، تم تطوير Oytser، وهو مجمع تدريب عالي الجودة يجمع بين مصادر إنترنت حديثة ومواد أدبية، بالإضافة إلى Kashes، وهو معيار متعدد المهام يتضمن ترجمة وتحليل لغوي واستخراج المعلومات وفهم اللغة.

باستخدام هذه الموارد، تم الاستمرار في تدريب Llama 3.1 (8B) للوصول إلى MameLoshnLM، وقد أثبت هذا النموذج أداءً أفضل من المعايير المفتوحة المماثلة. تُظهر التحليلات أن التحسينات لا تقتصر فقط على الأرقام، بل تتجاوز ذلك إلى التقاط أنماط لغوية وعُرفية تميزه عن نماذج متعدّدة الغرض، ما يشير إلى فشل أوسع في البيانات متعددة اللغات ذات الجودة المنخفضة للغات ذات الموارد المحدودة.

تقدم نتائج هذا البحث أساساً متيناً لـ NLP (معالجة اللغات الطبيعية) الخاصة باليديشية، ونموذجاً عملياً لتطوير نماذج لغوية للغات ذات تاريخ ثقافي غني ولكن بحضور رقمي محدود.

ما رأيكم في هذا التطور الجديد للغة اليديشية؟ شاركونا آراءكم في التعليقات!