في عالم الذكاء الاصطناعي، تزداد المنافسة بشكل ملحوظ بين النماذج المتعددة الوسائط والنماذج اللغوية المتقدمة، خاصةً مع إطلاق جوجل لنموذج الإدماج المتعدد الوسائط (Gemini Embedding 2) في مارس 2026. هذا النموذج الجديد يمكّن من ربط النصوص، الصور، الفيديو، والصوت بشكل متناسق في فضاء مشترك واحد، مما يتيح عملية استرجاع وتصنيف أكثر فعالية.

لكن السؤال الذي يطرح نفسه هو: هل يمكن لنماذج اللغة المتقدمة مثل GPT-4.1 وClaude Sonnet 4.6 منافسة هذا النموذج الجديد؟

دراستنا تسلط الضوء على أول مقارنة مباشرة بين إدماجات متعددة الوسائط ونماذج اللغة في تصنيف الصور من قاعدة بيانات Flickr30k. النتائج كانت مثيرة، حيث أظهرت أن أداء GPT-4.1 وClaude Sonnet 4.6 كان متساوياً تقريباً مع نموذج Gemini Embedding 2.

علاوةً على ذلك، عند احتساب الإدماجات مسبقًا، تبين أن إدماجات النماذج المتعددة الوسائط أكثر ملاءمة للتطبيقات التي تتطلب استجابة منخفضة التأخير. هذا يفتح آفاقًا جديدة للتطبيقات في مختلف مجالات الذكاء الاصطناعي.

هل تعتقد أن نماذج اللغة ستكون مستقبل البحث والتصنيف في عالم الصور؟ شاركونا آراءكم في التعليقات!