في عالم الذكاء الاصطناعي، يمثل التوافق بين النصوص والصور خطوة هامة لفهم المعلومات بشكل أفضل. نحن هنا نتحدث عن نماذج اللغات متعددة الوسائط (Multimodal Large Language Models - MLLMs) التي تعتمد على جهاز عرض لتنسيق التمثيلات المرئية مع مساحة التضمين اللغوي، مما يجعل عنصر التوافق ذا أهمية كبيرة لفهم المعاني عبر الوسائط المختلفة.
ومع ذلك، في ظل التحديات الخاصة بتدريب التعليم المستمر متعدد الوسائط (Multimodal Continual Instruction Tuning - MCIT)، فإن التحولات في توزيعات الصور وتطور معاني التعليم تؤدي إلى انحراف الجهاز المعني بالتوافق، مما يسفر عن نسيان حاد على مستوى الجهاز.
لذا، تأتي الحاجة إلى تطور جديد يحمل اسم 'التوافق متعدد الوسائط التقدمي' (Progressive Multimodal Alignment - PMA). يتيح هذا الإطار للجهاز المعني بالتوافق التكيف باستمرار مع الحفاظ على ما تم تعلمه سابقاً.
يعتمد PMA على الكشف عن تحولات التوزيع المتعدد الوسائط من خلال وصف تمثيلي خفيف، ويقوم بتوسيع خبراء الجهاز فقط عند الحاجة. كما يعمل جهاز توجيه قابل للتوسع على دمج مخرجات الخبراء بناءً على المزايا المتعددة الوسائط، مع الحفاظ على جهاز العرض المدرب مسبقًا كنقطة مرجعية مستقرة.
تظهر التجارب الواسعة التي أُجريت على معيارين حديثين في MCIT أن الحد من نسيان الجهاز المعني بالتوافق يؤدي إلى تحسينات متسقة تتجاوز الطرق السابقة. بالإضافة إلى ذلك، يثبت PMA قدرته على التوسع عبر هياكل MLLM المتنوعة، مما يعزز من أداء MCIT بشكل عام ويجعل النتائج ذات تطبيق واسع النطاق.
التقدم في التوافق متعدد الوسائط: إطار لتدريب مستمر في الذكاء الاصطناعي!
تمثل تكنولوجيا الذكاء الاصطناعي المتعدد الوسائط تطوراً مهماً في فهم المعلومات عبر مختلف الحواس. تستعرض الدراسة الجديدة إطاراً يتيح تحسين الأداء التعليمي لنماذج الذكاء الاصطناعي مع الحفاظ على التعلم السابق.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
