في عالم الذكاء الاصطناعي، يواصل التعلم الذاتي للخطاب (Speech Self-Supervised Learning) التطور لينتج نماذج قوية وغير تقليدية. في هذا السياق، أعلن الباحثون عن نموذج GLaS-JEPA، الذي يُعتبر خطوة جريئة نحو تبسيط العمليات الحالية في هذا المجال.

حتى الآن، يعتمد العديد من النماذج على أهداف معقدة ودقيقة، الأمر الذي يتطلب تصميمًا عالي الدقة لمكونات التدريب. لكن GLaS-JEPA يتميز بقدرته على التنبؤ المباشر بالتمثيلات المستمرة للموارد المستخدمة في التشفير (Encoder) في المواقع المخفية، دون الحاجة للاعتماد على التعلم التبايني (Contrastive Learning) أو أهداف منفصلة لتحسين الأداء.

الجوانب الاحتيارية لهذا النموذج تتضمن تقنيات مثل تنظيم الفراغ التمثيلي (SIGReg Representation-Space Regularization)، مما يسهم في استبعاد الحاجة لآليات إنشاء أهداف مصممة مسبقًا. تم تدريب GLaS-JEPA باستخدام 960 ساعة من بيانات LibriSpeech، حيث أظهر أداءً مذهلاً مع نموذج يحتوي على 57 مليون معلمة.

وترتبط النتائج التي حققها GLaS-JEPA بشكل وثيق، حيث أسفر النموذج عن معدل خطأ في التعرف على الكلمات (WER) بنسبة 6.89% على نموذج SUPERB ASR والمعدل القياسي للخطأ في شغل المهام (CER) بنسبة 25.87%، متفوقًا بفارق ملحوظ على أفضل النماذج المنافسة.

تشير هذه النتائج إلى أن التمثيلات الخطابية القابلة للتنافس يمكن أن تنشأ من وصفة تدريبية مبسطة للغاية، مما يفتح آفاقًا جديدة لاستكشاف تقنيات التعلم الذاتي.