في عالم الذكاء الاصطناعي، يُعد تحقيق كفاءة لغوية معينة (Language-specific competency - LSC) من التحديات الكبيرة، حيث تختلف ردود النماذج اللغوية تبعًا للغة المستخدمة في الاستعلام. بمعنى آخر، قد تنتج النماذج استجابات غير دقيقة أو غير متسقة عند التعامل مع استعلامات بلغة مختلفة.

تعتبر الطرق التقليدية لمعالجة هذه المشكلة، واحدة من اثنتين: إما توجيه جميع الاستعلامات عبر الإنجليزية، مما يحسن الأداء ولكنه يقيد التعبير اللغوي، أو التدريب على بيانات متوازنة لغويًا، مما يعادل الأداء بين اللغات ولكنه يقلل من القدرة العامة للنموذج.

قدم الباحثون في أحدث دراساتهم مفهومًا مبتكرًا يُعرف بـ HOTFIXR (Hardness Optimized Training data For Improving X-Lingual Reasoning)، وهو إطار لتوليد البيانات يستهدف تعزيز نقاط الضعف متعددة اللغات في النماذج. يعتمد HOTFIXR على استخدام نماذج معينة للنظر في القصور اللغوي، ومن ثم توليد بيانات مصطنعة لتجاوزها.

أظهرت التجارب أن HOTFIXR قادرة على تحسين الأداء في المهام اللغوية بنسبة تصل إلى 6.2%، وتقليل النسيان الكارثي بمعدل 3.7% في المهام خارج التوزيع، و7.1% في اللغات الخارجية.

إن فائدة هذا الابتكار تكمن في أنه يسهم في تعزيز القدرات متعددة اللغات للنماذج اللغوية، وهو ما يبدو ضروريًا لتلبية متطلبات التطبيقات الواقعية العالمية. من المتوقع طرح الكود البرمجي لهذا الإطار بعد القبول لنشره ليكون في متناول الجميع.