في خطوة جديدة ومثيرة، يقوم فريق من الباحثين بدراسة تقنية تعلم التنبؤ المسبق لتمثيل المستندات العلمية، معتمدين على الهيكل الخطابي للمقالات العلمية. وقد اقترحوا نظامًا مبتكرًا يسمى SciJEPA، الذي يعمل من دون الحاجة إلى الاستشهادات.

تتمثل الفكرة في استخدام تمثيلات العنوان والملخص لتوقع تمثيلات الطرق، بينما تُستخدم تمثيلات الطرق لتوقع تمثيلات النتائج. تُظهر التجارب المُدارة على مجموعة بيانات RELISH ونموذج البيانات العالية التأثير SciDocs أنه رغم أن التدريب التنبؤي البسيط هو خيار قابل للتطبيق، إلا أنه يُظهر أداءً أقل مقارنةً مع منهج مقارن مُدار باستخدام نفس أزواج الأقسام.

أحد الاكتشافات المثيرة هو تأثير تقنية التماسك المعروفة باسم Sliced Isotropic Gaussian Regularization (SIGReg) والتي تساعد في تعزيز أداء النظام وتقليص الفجوة بين النتائج. يعتمد تأثير هذه التقنية على طبيعة المهمة، حيث تساعد SIGReg المعتدلة في التسلسل الدقيق، بينما يمكن أن تضعف التماسك المحلي عند استخدام قوة أكبر.

تعد هذه النتائج خطوة مهمة في وضع تعلم التنبؤ داخل المستندات كبديل واعد لتقنيات التمثيل العلمي، شريطة التحكم بعناية في هندسة التضمين. مما سيغير بشكل جذري كيفية معالجة وتحليل البيانات العلمية في المستقبل.