في عالم الذكاء الاصطناعي، تعتبر خوارزميات تقسيم الرموز (Tokenization) من العناصر الأساسية التي تحدد فعالية نماذج اللغة (Language Models). واستناداً إلى دراسة حديثة نُشرت على arXiv، تم التحقيق في نوعين من خوارزميات تقسيم الرموز السائدة: ترميز زوج البايت (Byte-Pair Encoding - BPE) وUnigramLM. هذه الخوارزميات تختلف على محورين رئيسيين، وهما الهدف الأمثل (compression vs. log-likelihood) والإجراء البحثي (bottom-up merging vs. top-down pruning).
يواجه الباحثون تحديًا عندما يتعلق الأمر بمقارنة هذه الأنظمة، حيث إن الاختلافات الملحوظة تجعل من الصعب فهم ما إذا كانت هذه الاختلافات ناتجة عن ما يتم تحسينه أو عن كيفية تحسينه. ولكن الدراسة الجديدة قامت بفصل هذين العاملين من خلال تقديم خوارزميتين جديدتين: BottomUpLL، وهو مقسم يعتمد على الاحتمالية من الأسفل إلى الأعلى، وTopDownComp، وهو مقسم يعتمد على الضغط من الأعلى إلى الأسفل.
لقد تم تدريب نماذج اللغة باستخدام مقسمات تم إنشاؤها بواسطة كل خوارزمية مع تعديل بعض المتغيرات مثل حجم النموذج، وحجم المفردات، والنطاق (الإنجليزية فقط مقابل متعدد اللغات). عبر تقييم النماذج بناءً على عدد البتات لكل بايت، اتضح أن الإجراء البحثي - وليس الهدف - هو العامل الحاسم، حيث حققت مقسمات الرموز من الأسفل إلى الأعلى (Bottom-Up) نتائج أفضل بشكل متسق في معظم الإعدادات.
بينما أظهرت النتائج في مهمة BLiMP أنه لا يوجد علاقة ثابتة بين اختيارات التصميم والأداء. بشكل عام، تقدم هذه النتائج رؤية قيمة حول تأثير خيارات تصميم المقسمات على الأداء، مما يوفر إرشادات ملموسة لبناء نماذج لغة أكثر مبدأً.
ما رأيكم في أهمية هذه الخوارزميات في تطوير نماذج اللغة المستقبلية؟ شاركونا في التعليقات!
هل تؤثر خوارزميات تقسيم الرموز على أداء نماذج اللغة؟ اكتشافات مذهلة في الذكاء الاصطناعي!
تستعرض دراسة جديدة خوارزميات تقسيم الرموز في نماذج اللغة وكيف يؤثر شكلها على الأداء. النتائج تشير إلى أن طريقة البحث أكثر أهمية من الهدف الأمثل في تحقيق أداء أفضل.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
