تشكل تقنية الاسترجاع الكثيف (Dense Retrieval) عنصراً أساسياً في استرجاع المعلومات (Information Retrieval)، حيث تعد قاعدة للمهام الأخرى مثل إعادة التصنيف وتوليد المعلومات. في الآونة الأخيرة، أثبتت نماذج اللغات الضخمة (LLMs) قدرتها الكبيرة على فهم الجوانب الدلالية للنصوص، مما جعلها محط اهتمام الباحثين الذين يركزون على تحسين الاسترجاع الكثيف.

لكن يجب أن نلاحظ أن نماذج اللغات الضخمة هي نماذج توليدية تعتمد على الديكودر، ورغم تميزها في إنتاج النصوص، إلا أنها قد تعاني من القصور في نمذجة المعلومات العامة بسبب عدم Payattention إلى الرموز اللاحقة.

لذلك، قمنا بالاستلهام من المقاربة الكلاسيكية لنمذجة اللغة المعتمدة على الكلمات في مجال استرجاع المعلومات، وبالتحديد نموذج احتمالية الاستعلام (Query Likelihood Model). نهدف من خلال هذا النهج إلى الاستفادة من نقاط القوة التوليدية لنماذج اللغات الضخمة عبر تحسين احتمالية الاستعلام (QL Maximization).

بدلاً من استخدام تقدير احتمالية الاستعلام لتصنيف الوثائق، نقترح مهمة ثانوية تتمثل في تحسين احتمالية الاستعلام لتعزيز البنية الأساسية لتعزيز التعلم المتباين (Contrastive Learning) للباحث المتواصل.

نقدم نموذج LLM-QL الذي يتضمن عنصرين رئيسيين: "كتلة التركيز" (Attention Block) و"فساد الوثيقة" (Document Corruption). حيث تعمل كتلة التركيز على منع تركيز انتباه الرموز التنبؤية على رموز الوثيقة قبل انتهاء الوثيقة، بينما تفسد عملية الفساد الوثيقي الوثيقة عن طريق إخفاء جزء من رموزها أثناء التنبؤ.

أظهرت التقييمات على مجموعة بيانات MS MARCO ومجموعة بيانات BEIR الخارجية تفوق نموذج LLM-QL مقارنةً بباحثي LLM الآخرين. علاوة على ذلك، تؤكد التحليلات الشاملة فعالية LLM-QL وملحقاته، مما يعكس تقدماً ملفتاً في مجال استرجاع المعلومات باستخدام الذكاء الاصطناعي.