في عالم التطورات السريعة للذكاء الاصطناعي، تلعب استراتيجيات تحليل الوثائق (document chunking) دورًا حيويًا في تعزيز جودة استرجاع المعلومات. وفي دراسة حديثة منشورة على arXiv، تم النظر في كيفية تأثير تقنيات تقسيم المستندات على أداء نماذج اللغات الكبيرة (Large Language Models) في اللغة التركية، والمعروفة بغناها الصرفي ونحوها المعقد.

تناولت هذه الدراسة مقارنة ثلاثة استراتيجيات تقسيم: الطول الثابت، تقسيم دلالي، وتقسيم يعير الانتباه إلى تخطيط المستند (layout-aware). بالإضافة إلى ذلك، تم اختبار خمسة نماذج للتضمين (embedding models) واثنين من مولدات النماذج اللغوية.

أظهرت النتائج أن استراتيجية تقسيم المستند لها تأثير مباشر على فعالية نموذج التضمين؛ حيث يساعد تقسيم المستندات المستند إلى تخطيط في تقليل الفجوة بين نماذج التضمين الحديثة. وعند الاختبار، تبين أن النماذج الثلاثة الرائدة في التضمين كانت غير متميزة إحصائيًا، مما يعني أن التخصص اللغوي لا يضمن فائدة قابلة للقياس في الاسترجاع.

من المثير للاهتمام أن أسرع المولدات لا تظهر بالضرورة دقة أكبر، حيث تعتمد أفضل إعدادات التوليد على نوع المحتوى، إذ أن تقسيم المحتويات التي تحتوي على جداول يساعد بشكل أكبر مقارنة بالنصوص النثرية.

بلغت أعلى درجة للتقييمات 87.0% في التكوين الكامل، مما يثير التساؤل حول كيفية تحسين الأنظمة اللغوية لتعزيز فعالية الاسترجاع في لغات غنية نحويًا مثل التركية.

هل ترغب في معرفة المزيد عن تأثير التقنيات الرقمية على استراتيجيات تقسيم الوثائق؟ شاركونا أفكاركم في التعليقات!