في دراسة حديثة تبينت نتائج مثيرة حول تفضيلات ترتيب الكلمات، من خلال مقارنة شامل بين نماذج اللغة القائمة على التحويل (Transformers) و192 لغة اصطناعية وطبيعية متنوعة. حيث أظهرت هذه النماذج ميلاً بارزاً نحو تفضيل ترتيب الكلمات اليساري في اللغات الاصطناعية، وهو ما لا يتوافق مع الأنماط الطبيعية أو توقعات تعلم الإنسان لترتيب الكلمات.

ومع تحليل اللغات الطبيعية، لوحظ أن النماذج أحادية اللغة لا تعبر عن تفضيل واضح لترتيب الكلمات عند تحليل بيانات صغيرة، ولكن مع زيادة كمية البيانات، يتضح ميل قوي نحو اللغات ذات ترتيب الفاعل-فعل-مفعول (SVO). كما انخفض تفضيل ترتيب الفاعل-مفعول-فعل (SOV) رغم أنه الأكثر انتشاراً عبر اللغات.

على الرغم من أن هذه التفضيلات تتوسع لتشمل النماذج متعددة اللغات، إلا أنها تتأثر بمستوى الموارد اللغوية وجودة البيانات، وليس فقط بترتيب الكلمات. وهذا يدل على أن نفس البنية المعمارية يمكن أن تُظهر تفضيلات متباينة بين اللغات الاصطناعية والطبيعية، مما يؤكد أن التفضيلات الملاحظة هي نتاج للبيانات من حولنا.

مع تزايد اعتماد نماذج اللغة الكبيرة (LLMs)، فإن التوجه نحو اللغات SVO قد يؤثر على تنوع ترتيب الكلمات في اللغات الأخرى التي تستخدم ترتيبات متعددة، مما يفتح باب النقاش حول تأثير الذكاء الاصطناعي على مستقبل لغاتنا. كيف يمكن أن نضمن توازن التنوع المعلوماتي في ظل هذه الاتجاهات المتطورة؟ ما رأيكم في هذا التطور؟ شاركونا في التعليقات!