تُعتبر عملية اختيار النموذج الأمثل لتضمين النصوص (Text Embedding Model) واحدة من أكثر القرارات تأثيرًا في بناء أنظمة البحث والاسترجاع، ولكن على الرغم من هذا، فإن النماذج التي تتصدر قوائم التقييم نادرًا ما تكون الخيار الأنسب لأي تطبيق معين.

في هذا التقرير، تم تطوير إطار عمل عملي يعتمد على الأدلة لاختيار نموذج التضمين، مستندًا إلى دراسة تقييمية تتناول النموذج التجاري T3EM (Text 3 Embedding Model) الذي يعتمد على واجهة برمجية، وتتم مقارنته بمجموعة واسعة من البدائل المفتوحة المصدر على مهام الاسترجاع باللغة الإنجليزية.

خلال هذا البحث، تم وضع هذه النتائج في سياق نطاق واسع من معايير تقييم تضمين النصوص (Massive Text Embedding Benchmark - MTEB) والتي تشمل التصنيف (classification)، والتجميع (clustering)، والتشابه الدلالي (semantic similarity)، وإعادة الترتيب (reranking)، وتصنيف الأزواج (pair classification)، واستخراج النصوص الثنائية (bitext mining)، والتلخيص (summarization).

علاوة على ذلك، يتبع التقرير المسار الكامل من النموذج المستخدم في التضمين إلى النتائج المسترجعة. حيث يبرز كيف يتم إنتاج التضمينات، وكيف يتم فهرستها والبحث عنها على نطاق واسع، وكيف تحدد استراتيجية تقسيم الوثائق جودة الاسترجاع.

وبذلك، يتمكن المختار من فهم كيفية التفكير في اختيار النموذج كجزء من عملية استرجاع كاملة بدلاً من التعامل معه بشكل منفصل.

وفي نهاية التقرير، يتم عرض مجموعة من التوصيات العملية لاختيار نموذج التضمين بناءً على المهام، والكمون (latency)، والتكلفة، وقيود النشر. هذا الدليل يقدم دعوة للمحترفين في مجال البيانات وتحليل النصوص للاهتمام بجودة خيارات التضمين وأثرها الكبير على أداء الأنظمة.