تعتبر عملية انتقاء البيانات أمرًا حيويًا عند تدريب نماذج اللغات الضخمة (Large Language Models) على مجموعات بيانات شاملة ومتنوعة. وفي هذا السياق، تم تقديم مفهوم التعلم الذاتي (Meta-learning) كبديل مبدئي لتحسين انتقاء البيانات، إذ يعمد إلى تعلم أوزان البيانات استنادًا إلى الهدف الصحيح. ومع ذلك، تواجه الطرق الحالية تحديات تتمثل في الموازنة بين تقييم دقيق وقابلية النقل إلى بيانات غير مُشاهَدة.

الحل الطبيعي لهذه المشكلات هو استبدال الأوزان لكل عينة بشبكة انتقاء، لكن التجارب كشفت أن دمج هذه الشبكة مباشرة في الأهداف التدريبية الحالية يؤدي إلى صعوبات في تحسين الأداء وعدم القدرة على التعميم، نتيجة للضغط على الأوزان والاعتماد المستمر على الميزات السهلة التعلم.

لمعالجة هذه العراقيل، تم تقديم نموذج انتقاء البيانات القابل للتحويل (Transferable Example Scoring and Selection - TESS)، وهو إطار عمل يقدم طريقة جديدة قائمة على هدف مطابقة القيمة النقطية (Pointwise Value Matching - PVM). أظهرت التجارب التي تم إجراؤها على أمان نماذج اللغات الضخمة وضبط التعليمات المستهدف نقلًا قويًا عبر مجموعات البيانات، من الأجزاء إلى المجموعات الكاملة، ومن النماذج الصغيرة إلى الكبيرة.

لمزيد من المعلومات عن كيفية استخدام تكنولوجيا TESS لتحسين أداء نماذج الذكاء الاصطناعي، تابعونا في مقالاتنا القادمة!