تسعى الدراسات الحديثة إلى تعزيز قدرة أنظمة الذكاء الاصطناعي على التعامل مع المعلومات الكيميائية المعقدة، خاصة عند إجابة الأسئلة العلمية. في هذا السياق، قامت إحدى الدراسات بإجراء تحليل شامل لتأثير استراتيجيات تقسيم الوثائق (chunking) على فعالية استرجاع المعلومات. تُظهر النتائج كيف يمكن أن تؤثر خيارات تقسيم النصوص على دقة ودعم الإجابات العلمية المنتجة بواسطة أنظمة AI.

أظهرت الدراسة استخدام مجموعة بيانات ChemQuests، التي تحتوي على 952 زوج سؤال-جواب مأخوذة من 151 ورقة بحثية في الكيمياء، لإجراء تجارب على فئات مختلفة من استراتيجيات تقسيم النصوص. حيث تم فحص 41 نموذجًا للتمثيل (embedding) في سياقاسترجاع المعلومات الكيميائية، وتم تقييم فعالية كل نموذج باستخدام مقاييس دقيقة مثل Geom@10.

تم العثور على أن نماذج معينة مثل E5 ونموذج Beijing Academy of Artificial Intelligence General Embedding (BGE) كانت من بين الأقوى في مساعدة النظام على استرجاع المعلومات بدقة. كما أظهرت النتائج أن اختيار الاستراتيجية المناسبة لتقسيم النصوص يمكن أن يكون له تأثير كبير على جودة المعلومات المسترجعة.

في النهاية، توصلت الدراسة إلى أن استخدام كتل متوسطة إلى كبيرة، بالتوازي مع استراتيجيات تقسيم معينة، يعد خيارًا فعالًا لتحسين مراحل البحث في أنظمة RAG المعنية بالكيمياء. هذه النتائج تصب في مصلحة المطورين والعلماء الذين يسعون لتحسين أداء النماذج في هذه المجالات المعقدة.