في خطوة جديدة نحو تعزيز قدرات الذكاء الاصطناعي، تم تقديم نموذج CoJEPA الذي يجمع بين التعلم التبايني (Contrastive Learning) ونموذج JEPA (Joint-Embedding Predictive Architecture). يُعتبر نموذج JEPA فعالاً في تعلم التمثيلات الغنية من خلال التنبؤ الذاتي في الفضاء الكامن، لكن غالباً ما يعتمد على بنية المعلم-طالب (Teacher-Student) لتحقيق الاستقرار في التدريب، مما قد يؤدي إلى تمثيلات غير معلوماتية.

من ناحية أخرى، يُظهر التعلم التبايني استقرارًا كبيرًا أثناء التدريب ويقدم تمثيلات شاملة قوية، لكنه لا يزال محدودًا في المهام المحلية بسبب طبيعته العالمية. لذا، تم دمج هذين النموذجين بشكل مبتكر في CoJEPA، حيث يعمل على تطوير تمثيلات موسيقية تشمل الجوانب العالمية والمحلية.

تقوم فكرة CoJEPA على وجود هيكل خلفية مشترك يتم تدريبه بشكل مشترك على الأهداف المختلفة، من خلال استخدام الرموز التسلسلية المخفية (Masked Sequence Tokens) جنبًا إلى جنب مع هدف تعليمي تبايني على رمز الفئة (Class Token). ويتميز هذا النموذج بأنه يوفر الاستقرار عبر استخدام التدرجات التباينية، مما يلغي الحاجة للاعتماد على معلم EMA لتحسين الأداء. كما أن نموذج JEPA يعزز الرموز التسلسلية من خلال التنبؤات المحلية، التي لا يمكن أن يوفرها التعلم التبايني وحده.

أبرز ما جاء به CoJEPA هو عدم الحاجة لإضافة أي معلمات إضافية إلى الهيكل الأساسي، بل يتم توجيه النموذج نحو تمثيلات أغنى فقط من خلال تصميم إشارة التدريب. أثبت CoJEPA فعاليته من خلال أداء متفوق أو متساوي مع الطريقتين الفرديتين في المهام العالمية والمحلية لفهم الموسيقى، مبرزاً بشكل خاص قدراته القوية في الفهم النغمي والنغمات.

يشير CoJEPA إلى أن دمج الأهداف ذات الانحيازات الاستنتاجية التكميلية يمكن أن يُحَسِّن التمثيلات دون الحاجة للاعتماد على زيادة حجم النموذج، مما يشجع الأبحاث المستقبلية على التركيز على تطوير أهداف تدريب أذكى بدلاً من تكبير النماذج بشكل مفرط.