أعلنت الأبحاث الحديثة عن تطوير منهجية جديدة في مجال الذكاء الاصطناعي تُعرف باسم Reason What Matters (ReWAM)، والتي تعزز من أداء عمليات الاسترجاع متعددة الأنماط (Universal Multimodal Embeddings). تهدف هذه المنهجية إلى تعلم تمثيلات موحدة عبر الأنماط المختلفة، مما يسمح لنموذج واحد بدعم مهام استرجاع متنوعة.

تستند العديد من الأساليب الحالية إلى منهجية Chain-of-Thought (CoT) reasoning لتحسين تفسير المدخلات المتعددة الأنماط قبل توليد التمثيلات المطلوبة. ومع ذلك، كانت هناك بعض القيود التي تحد من نطاق استخدام هذه التقنيات على مستوى واسع. فعلى سبيل المثال، تقوم تقنية GRPO بتوزيع نفس الفائدة على جميع رموز CoT، مما لا يساعد في تمييز المدخلات المدعومة التي تميز الإيجابيات عن السلبيات. وعلاوة على ذلك، تتسبب الحاجة إلى توليد مسار CoT كامل قبل كل تمثيل في تأخير كبير في الأداء.

لتجاوز هذه التحديات، تقدم ReWAM إطارًا جديدًا يستند إلى استرجاع التغذية الراجعة لتوجيه كل من تخصيص الفائدة وعمليات تفسير reasoning. حيث تم تقديم تقنية Retrieval-aware Self-Distillation (RASD)، التي تستخرج توجيهًا مميزًا من الأدلة المدعومة بالمدخلات التي تمثل العنصر الإيجابي، مما يتيح تحسين عمليات الاسترجاع. بالإضافة إلى ذلك، تم تطوير تقنية Retrieval-adaptive Inference (RAI) التي تعمل على تحسين تقدير الجدوى المتبقية للاسترجاع بواسطة CoT جزئي.

أظهرت التجارب الموسعة على نماذج MMEB-V2 وMRMR أن ReWAM تدخلت في تحقيق أداء استرجاع رائد، حيث وصلت السرعة في عمليات الاستنتاج إلى خمسة أضعاف الأساليب التقليدية.

يوفر هذا الإنجاز جسرًا بين جودة الاسترجاع وكفاءة الاستنتاج، مما يجعل عمليات التفسير المعززة بواسطة UME عملية وقابلة للتطبيق على نطاق واسع. في ظل التقدم السريع في تقنيات الذكاء الاصطناعي، تبدو هذه الابتكارات كخطوات مهمة نحو مستقبل أكثر قدرة على تلبية متطلبات البيانات الكبيرة.