صممت دراسة حديثة لفهم كيف يمكن لنماذج اللغة المستندة إلى الذكاء الاصطناعي (AI) أن تتوقع أوقات القراءة باللغة الصينية. تستخدم هذه الدراسة نظامًا فريدًا يُعرف باسم أقصر تسلسل مطابق (Shortest Matching Sequence - SMS)، والذي يربط بين تقسيم الكلمات المعتمد في قواعد بيانات تتبع العين (Eye-tracking) وتجزئة الكلمات في نماذج اللغة.
تدور الدراسة حول نماذج صينية تدعى Chinese-Pythia، والتي تتراوح أحجامها من 14 مليون إلى 1.4 مليار معلمة، وتم تدريبها على مجموعة بيانات ضخمة تضم 30 مليار رمز. تم فحص قدرة المفاهيم المعبرة عن التعجب (surprisal) على توقع أوقات القراءة، بما في ذلك مدة النظرة الأولى، ومدة التحديق، وإجمالي وقت القراءة.
في مفاجأة للجميع، أثبتت النتائج أن التعجب فعلاً له تأثير على أوقات القراءة. ولكن ما يثير الاهتمام هو أن فعالية هذا التأثير مرتبطة بنوع مجموعة البيانات المستخدمة؛ ففي قاعدة بيانات GECO-CN، كانت النماذج الأكبر تقدم توقعات أفضل، بينما بالشكل العكسي في قاعدة بيانات HKP، وأيضًا في مجموعة MECO عند استخدام نماذج بأكبر أحجام.
لذا، تُظهر هذه النتائج أهمية فهم الخصوصيات المتعلقة بكافة مجموعات البيانات المستخدمة، مما يمنعنا من الاستنتاج من مجموعة واحدة فقط. فإن تحليل الرؤى حول التعجب والقراءة باللغة الصينية يمكن أن يعزز فهمنا لكيفية عمل الدماغ خلال هذه العملية.
الذكاء الاصطناعي يكشف سر قراءة الصينية: دراسة تحليلية مبتكرة!
تسليط الضوء على قوة النموذج اللغوي في توقع أوقات القراءة باللغة الصينية، من خلال دراسة مبتكرة تتناول العلاقة بين مفاهيم التعجب وتوقيتات القراءة. النتائج تكشف تفاصيل مثيرة عن كيفية تأثير حجم النموذج على دقة هذه التوقعات.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
