في عالم الذكاء الاصطناعي، يعتبر التركيز على الارتقاء بالأداء أمراً بالغ الأهمية. إذ يُعد اختيار نموذج لغوي كبير (LLM) كقاعدة أساسية عند بناء نموذج لغة متعددة الوسائط (VLM) من أهم القرارات. ومع ذلك، لا تزال هذه العملية غير منهجية تماماً، حيث تُظهر القوانين القائمة على الحسابات أن الأسوبت التقليدية لا تعمم بين عائلات النماذج المختلفة.
في أحدث الأبحاث، تم اقتراح القانون الجديد الذي يعتمد على القدرات (Capability-Driven Multimodal Scaling Law)؛ يعد هذا الإطار الأول من نوعه الذي يسمح بتوقع دقة الأداء لنماذج VLM بناءً على القدرات النصية القابلة للملاحظة. من خلال تحليل أداء النموذج بناءً على مقياس قدرة منخفض الأبعاد $S$ المُستخلص من معايير نصية باستخدام تحليل المكونات الرئيسية (PCA)، يصبح من الممكن تقييم أداء النموذج بشكل أكثر دقة.
تم تدريب أكثر من 150 نموذج VLM على 34 نموذج LLM من 7 عائلات نماذج في إطار تحكم صارم، مما أدى إلى تقييمات على أكثر من 200 معيار نصي و50 معيار متعدد الوسائط. وتظهر النتائج أن هذا القانون يعكس بدقة معدل النقل من نماذج تصل إلى 8 مليارات معلمة إلى نماذج كبيرة بحجم 72 مليار معلمة، ويساعد في التنبؤ بمسارات التدريب بدقة عالية.
أما بالنسبة لبقية التحليلات، فقد كشفت النتائج أن بعض المعايير النصية ترتبط سلباً بأداء النماذج متعددة الوسائط، مما يشير إلى سلوك مريب عند تقييم المعايير؛ كما أن النماذج الأساسية (Base LLMs) تتفوق على نظيراتها المعززة بالتعليم عند استخدامها كنماذج أساسية بسبب معدلات الامتصاص الأعلى.
ومع هذا الإطار، يتحول اختيار النموذج الأساسي من جهد تجريبي مكلف إلى قرار كمي منهجي. يمكنكم الوصول إلى الكود والبيانات على [https://github.com/wangq-dev/CDMScaling].
هل يمكن لنقل النصوص إلى الرؤية تحسين نماذج اللغة متعددة الوسائط؟ اكتشافات مذهلة!
يتناول هذا المقال أهمية اختيار النموذج اللغوي الكبير المناسب عند بناء نماذج اللغة متعددة الوسائط. كما يقدم إطار عمل مبتكر يتوقع أداء هذه النماذج بدقة قبل بدء التدريب.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
