في تطور بارز في مجال الذكاء الاصطناعي، تم تقديم نموذج OPD-V الذي يستخدم تقنية **التقطير الذاتي (Self-Distillation)** لتحسين مهارات التفكير البصري في **النماذج اللغوية متعددة الوسائط (Multimodal Large Language Models)**. في ظل تصميمات سابقة تعتمد على معلومات مميزة من مصادر متعددة، كانت هناك مشكلة كبيرة تُعرف باسم **عدم توازن الوسائط (Modality Imbalance)**، حيث تهيمن المعلومات النصية على التوليد، مما يعيق الاندماج الكامل للمعلومات المتعددة الوسائط.
لتجاوز هذه التحديات، قام الباحثون بتطوير نموذج جديد يُعرف بوجود **معلم إيجابي (Positive Teacher)** يستخدم صورة مكبرة، ومعلم سلبي (Negative Teacher) يقوم على صورة محجوبة، وهذا يوضح مستويات مختلفة من **عدم توازن الوسائط**. من خلال تحليل مدى دقة الاستنتاجات التي توصلت إليها هذه النماذج، تبين أن تحقيق توازن الوسائط يُعتبر بمثابة معلومات مميزة بمفردها.
استنتج الباحثون من ذلك تقديم نموذج OPD-V، الذي يجمع بين المعلومات المستخلصة من المعلمين الإيجابي والسلبي. باستخدام **هامش لوجيت توازن الوسائط الإيجابية (Positive Modality-Balance Logits Margins)**، يتم تحديد منطقة **ثقة توازن الوسائط (Modality-Balance Trust Region)** التي تختار الرموز المستخدمة في عملية التقطير الذاتي.
أظهرت التجارب التي أجريت على 6 مؤشرات و4 أُسُود لنماذج اللغات متعددة الوسائط و5 طرق ما بعد التدريب أن OPD-V يعزز الأداء في التفكير بشكل مستمر ويقلل من تكاليف التدريب. هذا الابتكار يشكل خطوة كبيرة نحو تحسين الفعالية في تطبيقات الذكاء الاصطناعي المتقدمة.
ثورة في الذكاء الاصطناعي: تعرف على OPD-V وتحقيق التوازن في النماذج متعددة الوسائط!
يكشف OPD-V عن طريقة ثورية لتحسين التفكير البصري في نماذج اللغات متعددة الوسائط عبر تحقيق توازن بين المدخلات. الطريقة الجديدة تظهر فعالية ملحوظة في أداء النماذج مع تقليل تكاليف التدريب.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
