في عالم يُهيمن عليه تدفق المعلومات، يبرز سؤال جوهري حول كيفية تحسين عملية نقل المعلومات في النصوص. تشير الأبحاث الحديثة إلى أن التنظيم الدلالي للغة يلعب دورًا محوريًا في ذلك. وفقًا لدراسة نُشرت في arXiv، يمكن للبشر والنماذج اللغوية الكبيرة (Large Language Models) التنبؤ بالكلمات أو الأحرف التالية بفاعلية تفوق التخمين العشوائي، مما يدل على وجود فائض قوي في اللغة.

تُشير التقديرات التي أعدّها العالِم الشهير كلود شانون إلى أن هذا الفائض يقدر بحوالي 80%. في هذا السياق، يعكس كل حرف في النصوص المطبوعة تقريبًا 1 بت من المعلومات، بينما يمكن أن يحمل ما يصل إلى 4.8 بت. لكن السؤال الذي يطرح نفسه هو: ما هي التنظيمات الإحصائية التي تساهم في هذا الفائض الكبير؟

تحتوي الدراسة الجديدة على إطار إحصائي يتناول هذا الموضوع، حيث يربط بين الفائض المدروس والتنظيم الدلالي الهرمي للنصوص، باستخدام تقنيات النماذج اللغوية الكبيرة لتقسيم النصوص إلى أجزاء متماسكة دلاليًا. كل قسم من النص يُظهر شجرة دلالية، مما يُعزز من فهمنا لكيفية تنظيم الأفكار داخل النص.

بالنظر إلى العديد من النصوص، سواء كانت قصصًا خيالية أو أدبًا شعريًا، تم العثور على أن أشجار الدلالية تمتاز بانتظام إحصائي معين، مما يُنتج معدل انتروبيا هيكلي. المفاجأة كانت في أن معدلات انتروبيا الأشجار الدلالية كانت قريبة من الكميات التي تقيسها النماذج اللغوية الكبيرة. على سبيل المثال، النصوص البسيطة مثل قصص الأطفال أظهرت انخفاضًا في تفرع الأشجار الدلالية، بينما الأسر القصصية والشعر كانت لها درجات تفرع أكبر ومعدلات انتروبيا أعلى.

توضح هذه النتائج أن تنظيم اللغة بشكل هرمي يُعتبر عاملًا مهمًا في تحديد معدلات نقل المعلومات في النصوص، مما يفتح الأبواب لفهم أعمق لكيفية عمل الاتصالات الإنسانية من خلال الكلمات والأفكار. كيف تعتقد أن هذه الدراسات ستؤثر على وسائل التواصل وكتابة المحتوى؟ شاركونا وجهات نظركم في التعليقات!