تُعد عمليات التجميع اللغوي (Tokenization) عنصراً معقداً ومهماً في عصر الذكاء الاصطناعي المتعدد اللغات. وفي دراسة جديدة، أبرز الباحثون كيف أن عمليات التجميع المتبعة في النماذج اللغوية الحديثة تؤثر بشكل كبير على اللغات السلافية مثل الأوكرانية، حيث يلاحظ أن تكاليف التجميع تتجاوز تلك الخاصة بالإنجليزية بنسبة تصل إلى 121%. يُظهر البحث أنه عندما يتم استخدام نماذج تجميع متطورة، يتسبب ذلك في كسر الاستخدام اللغوي الحالي وخلق شذوذات كبيرة في السعة السياقية.

لقد تم إجراء التحليلات على تسعة نماذج تجميع تجريبية وبلغات متعددة تغطي ما يصل إلى 8.37 مليون شكل لفظي. وعلى وجه تحديد، يُظهر نموذج الأوكرانية تكاليف إضافية تصل إلى 220% عند استخدام النماذج القديمة مثل CL100K. وعلى الرغم من أن هناك ارتباطًا سلبيًا مع تخصيص المفردات السلافية، إلا أن البيانات لم تكن ذات دلالة إحصائية.

بالإضافة إلى ذلك، تم تقييم استراتيجيتين للتخفيف من هذه المشاكل. حيث تُظهر تقنيات مثل LLMLingua-2 تحسينًا ملحوظًا، حيث تساعد في تقليل طول المدخلات الأوكرانية بنسبة تتراوح بين 47 إلى 49%، دون إحداث أي خسائر من حيث القيمة. كما أن استخدام تقنية تجميع بايت على مستوى القاموس بحد أقصى 200K يدخل تحسينات ملحوظة على النسبة بين الأوكرانية والإنجليزية.

تؤكد النتائج على ضرورة تخصيص البيانات التدريبية لدعم اللغات السلافية بشكل أفضل، مما يوفر فرصة لتطوير نماذج أكثر كفاءة وفهماً لهذه اللغات. هذه النتائج توضح أن هناك إمكانيات حقيقية للتخفيف من التكاليف عند تصميم نماذج التجميع وفي مراحل استخدام الذكاء الاصطناعي المختلفة.

ما رأيكم بهذه التطورات في حقل الذكاء الاصطناعي؟ شاركونا آراءكم في التعليقات!