في عالم الذكاء الاصطناعي، تمثل نماذج متعددة الوسائط الموحدة (Unified Multimodal Models) قفزة نوعية في دمج قدرات الفهم والتوليد للصور. وهو ما يجعل هذه النماذج متميزة عن غيرها، حيث تتطلب مهارات متقدمة للتفاعل بين الفهم البصري والعمليات الإبداعية.
مؤخراً، تم تقديم الإطار الجديد MATE (Mutually Adversarial self-Training with Evolving Data)، الذي يتيح تدريباً ذاتياً يعتمد على التعلم المعزز. هذا الإطار يقدم نهجاً ثورياً بتحدي الفروع المترابطة، حيث يصبح كل فرع منافساً للآخر بشكل متبادل.
الفكرة الأساسية هنا تتمثل في أن كل فرع، سواء كان متعلّقاً بالتوليد أو الفهم، يقوم بتحدي الفرع الآخر بشكل دوري. على سبيل المثال، عند إدخال صورة، يقترح فرع الفهم عدة أوصاف مرشحة، ويتعين على فرع التوليد تحويلها إلى صور مشابهة. والعكس صحيح، مما يضمن وجود عملية تفاعلية مستمرة بين الأفرع.
هذه الطريقة لا تقتصر فقط على تحديات داخلية بسيطة، بل تتطور مع تقدم النمذجة والتدريب. وعندما تنجح أوصاف معينة في تجاوز أحد الفروع، تصبح مصدراً للتحديات في الفترات التالية، مما يساعد على خلق دورة تعلّم ذاتية من البيانات.
ووفقًا للنتائج، أظهر MATE تحسينات ملحوظة على العديد من المقاييس؛ إذ زادت نقاط GenEval بمقدار 2.4 نقطة، وDPG-Bench بمقدار 1.7 نقطة، بينما ارتفعت متوسط النقاط على تسع مقاييس فهامة بمقدار 0.7 نقطة، مما يعزز من الاتساق عبر دورات الصورة والنص المتكررة. هذا الإنجاز يسهم بشكل كبير في تطوير نماذج ذكاء اصطناعي أكثر دقة وفعالية.
مبدأ خاص: تدريب ذاتي تنافسي بتطور البيانات لنماذج متعددة الوسائط الموحدة
تسعى نماذج متعددة الوسائط الموحدة إلى دمج فهم الصور وتوليدها، مما يخلق تحديات جديدة في مجال الذكاء الاصطناعي. يقدم MATE، الإطار الجديد القائم على التعلم المعزز، طريقة مبتكرة تعتمد على تعزيز التنافسية بين الفهم والتوليد.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
