في السنوات الأخيرة، برزت النماذج اللغوية الكبيرة (Large Language Models - LLM) كأدوات قوية تعتمد على جودة البيانات التدريبية لتحسين الأداء. ومع أن تصفية البيانات المستندة إلى النماذج أثبتت فعاليتها في اختيار مجموعات عالية الجودة من مجموعات البيانات الضخمة، إلا أن التحديات قائمة أمام اللغات ذات الموارد المحدودة بسبب نقص البيانات المشروحة.

في هذا الإطار، قام فريق من الباحثين بتطوير طريقة جديدة لتوسيع نطاق تصفية الجودة لتشمل أكثر من 100 لغة عبر اقتراح أسلوب التكيف متعدد اللغات. تعتمد هذه الطريقة على تحويل مصنف الجودة الموجود باللغة الإنجليزية إلى متغير متعدد اللغات، مما يفتح الآفاق أمام استخدام واسع للبيانات.

تقوم هذه الطريقة على تدريب شبكة عصبية متعددة الطبقات (multi-layer perceptron) فوق صور نماذج ترانسفورمر (Transformer) باستخدام نصوص متعددة اللغات، حيث يتم استخدام النتائج التي تم الحصول عليها من مصنفات اللغة الإنجليزية كنماذج تدريبية.

تظهر التجارب التي أجريت باستخدام مقاييس 1 مليار، 3 مليار و8 مليار أن هذه المقاربة تحافظ على أداء المعيار المرتبط بالنماذج اللغوية الكبيرة القائمة على التصفية دون التأثير سلبياً على المعرفة الإقليمية والثقافية.

لمزيد من تقييم تعميم النماذج عبر اللغات، تم مقارنة نتائج المصنفات الخاصة بالبيانات الاصطناعية عالية الجودة وعينات الويب، مما يكشف أن المصنف يمكنه استيعاب معايير التقييم حتى في اللغات التي لم تتواجد في بيانات التدريب الأصلية.

يبدو أن هذه التطورات تشير إلى مستقبل أكثر شمولية لنماذج اللغات الكبيرة، وتفتح المجال أمام تحسين الأداء العام للنماذج في سياقات لغوية متعددة.