في ظل التطور السريع لتقنيات الذكاء الاصطناعي، تبرز فائدة اختيار البيانات الذكي في تعزيز كفاءة تدريب نماذج اللغة الكبيرة (LLMs). في مقال جديد نُشر في arXiv، يتم الكشف عن مفهوم جديد يسمى OptiSelect، الذي يُعنى بكيفية تحسين خطوات اختيار البيانات وفقًا للمعايير التي يحددها المحسن (optimizer).

ارتكزت الدراسة على مبدأ الاختيار المبني على المميزات حيث يتم حساب قيمة كل مرشح بناءً على كيفية تأثير المحسن على البيانات الخام قبل تحديث معايير النموذج. وهنا يأتي دور OptiSelect لتحديد مكاسب الاختيار عبر تسليط الضوء على كيف يمكن أن تؤثر الطرق المختلفة في تحسين أداء النموذج.

تشير النتائج إلى أن استخدام المحسنين مثل Lion وMuon قد يولد عناء في القدرة على التمييز، مما قد يُقيد المكاسب المرجوة من استخدام OptiSelect. بالمقابل، أظهرت المحسنات القابلة للتكيف مثل AdamW وسوفسيا قدرة أعلى في تحقيق مكاسب أفضل.

ليس ذلك فحسب، بل أثبتت التجارب التي أُجريت على نماذج ضخمة تضم 124 مليون و720 مليون عنصر أن أسلوب التحسين القائم على المعادلات القابلة للتكيف لا يزال الأميز، حتى مع استخدام محسن Muon.

أبدى OptiSelect قدرة ملحوظة في الحفاظ على فوائده حتى بعد إعادة صياغة البيانات، مما يعكس أهمية المنهجية المقترحة في تسريع وتعزيز كفاءة التدريب على نماذج اللغة الكبيرة. تُقدم هذه النتائج إطارًا نظريًا وترشيحات عملية لتصميم المحسنات واختيار البيانات في تدريب LLM.