في عالم يتزايد فيه الاعتماد على تقنية الذكاء الاصطناعي لتحسين نتائج البحث، تظهر تقنية جديدة تُعرف باسم DEPT (توليف حفظ تجسيد الوثائق) كمحور اهتمام لعلماء البيانات والباحثين. تهدف هذه التقنية إلى معالجة التحديات التي تواجه استعلامات البحث الغامضة وتعديل كيفية استرجاع الوثائق بشكل أكثر دقة.

تستفيد DEPT من نماذج اللغة الكبيرة (Large Language Models - LLMs) التي يمكنها توسيع استعلامات البحث غير المحددة وتشفير النصوص كتمثيلات كثيفة. وعادة ما تعتمد الأنظمة الحالية على توسيع الاستعلامات بشكل مستقل أو وحدات مدربة بشكل منفصل، مما يجعل التحسينات الناتجة عن الاستعلامات تتماشى بشكل غير مباشر مع فقدان الاسترجاع الذي يحكمها.

لكن DEPT تأخذ خطوة للأمام من خلال تدريب نموذج LLM وحيد بشكل شامل، حيث يقوم نفس النموذج بإنشاء التوسعات وتشفير كلاً من الاستعلامات الموسعة والوثائق المرشحة. ومع ذلك، فإن هذا الإعداد الموحد يطرح مشكلة خفية: يتعين على الإشراف على الاسترجاع تحسين توسع الاستعلام، لكن التحديث نفسه يقوم أيضًا بتحويل تجسيدات الوثائق التي تعمل كأهداف استرجاع.

تقدم تقنية DEPT حلًا فعالًا من خلال الحفاظ على تجسيدات الوثائق المعدلة قريبة من التجسيدات الأولية المخزنة، مما يسمح لتدرجات الاسترجاع بالمرور إلى مُولد التوسع. هذه التقنية تحول حركة التعديل المشتركة بين الاستعلامات والوثائق إلى تكييف في جانب الاستعلام مقابل تجسيدات وثائق مستقرة نسبيًا تدعم إعادة استخدام الفهارس والتقنيات السلبية الصعبة عبر الإنترنت.

أظهرت التجارب باستخدام نماذج مثل Qwen3-4B-Instruct-2507 وLLaMA-3.2-3B-Instruct عبر خمسة مجموعات بيانات في معايير BEIR أن DEPT تحسن متوسط جودة الاسترجاع مقارنة بأساليب موحدة أخرى لا تعتمد على التدريب، مما يجعلها نسبة عاليه فعالة.

للمزيد من التفاصيل، يمكنك زيارة الشيفرة المصدرية المتاحة هنا.