في عالم الذكاء الاصطناعي، يُعد استرجاع المعلومات أحد التحديات الأساسية التي تسعى النماذج إلى تحسينها. حيث يتم تدريب نماذج الاسترجاع الكثيفة عادةً على أهداف تباينية تُركز على تعلم تمثيلات فعالة، ولكنها لا تُحقق تحسينات مباشرة في معايير الاسترجاع أو أداء المهام التالية. للتعامل مع هذه الإشكالية، قدّم الباحثون إطارًا جديدًا تحت اسم RELER (التعلم التعزيزي للاسترجاع) الذي يمكّن النماذج الحالية من التعلم لاسترجاع المعلومات مباشرةً في الفضاء التمثيلي، مما يتماشى مع المكافآت الخاصة بالمهام.

تعتمد طريقة RELER على أخذ عينات من إجراءات استعلام وثيقة بواسطة توزيعات فون ميسيس-فيشر (von Mises-Fisher)، مما يتيح تقييم النتائج الناتجة عن الاسترجاع واستخدامها كمكافآت لتحديث نماذج التشفير باستخدام طريقة REINFORCE مع قاعدة ترك واحدة (leave-one-out baseline). ومع ذلك، وبما أن الاستكشاف في الفضاء التمثيلي عالي الأبعاد قد يتعرض للضوضاء، وضع الباحثون أيضًا اقتراحًا يُعرف باسم الإسقاط الشرطي المتوسط (conditional-mean projection - CMP)، الذي يسهم في تقليل الضوضاء في تدرجات السياسة مع الحفاظ على توقعاته.

تم تقييم أداء RELER على منهج BRIGHT، الذي يحتوي على استفسارات تتطلب تفكيراً عميقاً، وأثبتت النتائج أن RELER يتفوق باستمرار على تقنيات InfoNCE وLambdaLoss في متوسط النسبة القابلة للتنفيذ (nDCG@10) عند استخدام نماذج BGE-M3 وQwen3-Embedding.

علاوة على ذلك، تم تقييم utility downstream من خلال الجيل المعزز بالاسترجاع (RAG)، حيث تم تعديل مشفر الاستعلام فقط بينما ظل فهرس الوثائق والمولد ثابتين. أشارت النتائج عبر سبع مجموعات بيانات QA إلى أن تحسين الاسترجاع ومكافآت الإجابة بشكل مشترك يعزز من أداء الاسترجاع المتوسط وجودة الإجابات بشكل فعال.

هذا التطور الجديد في استخدام التعلم التعزيزي في إطار RELER يمثل خطوة كبيرة نحو تحسين استرجاع المعلومات، مما يفتح آفاقًا جديدة لجميع نماذج الذكاء الاصطناعي في كيفية تقديم المعلومات بدقة وكفاءة أعلى.