في عالم الذكاء الاصطناعي، على الرغم من قوة نماذج التضمين القائمة على نماذج اللغة الكبيرة (MLLM)، إلا أنها تواجه صعوبة في عملية الاسترجاع التكويني، حيث تفشل أحياناً في تمييز المشاهد التي تحتوي على نفس المفاهيم ولكن بترابطات مختلفة. ومع ذلك، يمكن لنفس الهيكل العظمي أن يحل مثل هذه التمييزات عند استخدامه كمُعيد ترتيب متقاطع، مما يحفزنا على تقطير الأحكام التكوينية إلى نموذج التضمين.

لذلك، قدّم الباحثون تقنية CORE، التي تجمع بين قوائم مرشحة تغطي خمسة مستويات متعلقة بالتطابق التكويني، وتقدم هدف Rank-KL الذي يُعلم نموذج التضمين لاستنساخ ترتيب المُعيد بشكل دقيق. كما أنه تم تقديم بروتوكول تقييم تدريجي، وجرى مقارنة التعلم التبايني، وCoSENT زو الزوجي، وRank-KL باستخدام نفس بيانات الميزانية للتعديل.

أظهرت المقارنة أن كل من CoSENT وRank-KL يستخدمان الإشراف المتعدد المستويات بشكل أكثر فعالية مقارنةً بالتعلم التبايني، حيث حقق Rank-KL أقوى أداءٍ شامل. عبر ثلاثة معايير للاستدلال التكويني (COLA، SUGARCREPE++، NEGBENCH)، حقق CORE-RERANKER-8B متوسطاً إجمالياً قدره 82.7%، متفوقاً على Jina-Reranker بفارق 10.7 نقطة، بينما حقق CORE-EMBED-8B أفضل متوسط إجمالي (0.666) بين جميع نماذج التضمين المفحوصة.

تُظهر تحسينات CORE انتقالاً واضحاً إلى معيار MCMR دون التضحية بأداء الاسترجاع في قواعد بيانات مثل COCO وFlickr30K. هل يمكن أن يكون هذا التطور رمزاً لمستقبل الذكاء الاصطناعي؟ شاركونا آرائكم في التعليقات.