في عالم الذكاء الاصطناعي، تتطور نماذج اللغات الكبيرة متعددة الوسائط (MLLMs) باستمرار، ولكن ما يزال هناك تحدٍ كبير يتمثل في عدم كفاية المعلومات المعرفية المنمذجة ضمن هذه النماذج، مما يجعل من الصعب تحديثها. وقد أدى هذا إلى الحاجة إلى تطوير آلية الاسترجاع المعزز متعدد الوسائط (RAG) التي تعتمد على النصوص والصور الخارجية لتوفير سياقات جواب أكثر دقة.
ومؤخراً، تم تقديم معيار CrossModalQA كخطوة جديدة نحو تحسين هذا الأمر، حيث يُعتبر معياراً مفتوحاً لتقييم الاسترجاع متعدد الوسائط والتفكير عبر المصادر المتنوعة. يحتوي CrossModalQA على 1863 زوج من الأسئلة والأجوبة مستمدة من 4987 مقالة في ويكيبيديا و4431 صورة من ويكيميديا كومنز.
يغطي هذا المعيار خمسة مسارات من التفكير المتكامل: من الرؤية إلى النص، ومن النص إلى الرؤية، ومن الرؤية إلى النص ثم إلى رؤية أخرى، وتداخل الصور المتعددة، وأخيراً التفكير في مجموعات الصور. حيث يتطلب كل سؤال استرجاع وتجميع الأدلة النصية والمرئية الموزعة، مع عمق تفكير متوسط يتجاوز 3.50 خطوة.
تستخدم عملية بناء هذا المعيار تكنولوجيا الرسم البياني المعرفي متعدد الوسائط للإرشاد في أخذ العينات، بالإضافة إلى آليات فحص الاتساق المستندة إلى القواعد والتحقق بواسطة نماذج اللغات الكبيرة (LLM) لضمان الاعتماد المتعدد الوسائط والأدلة القابلة للتتبع.
ومع ذلك، أظهرت التجارب الواسعة أن الأنظمة الحالية للاسترجاع المعزز متعدد الوسائط تواجه صعوبة في استعادة سلاسل الأدلة كاملة، ويمكن أن تتخلف في الأداء عن النماذج التقليدية عند تقديم سياقات مُربكة نتيجة الاسترجاع غير المكتمل. كما أظهرت التحليلات أن الاسترجاع المتكامل عبر الوسائط يسهم بشكل أكبر في دقة الإجابات مقارنة بتوسيع حجم المولد، بينما لا تزال عمليات الاسترجاع والتفكير في الصور المتعددة تشكل نقطة ضعيفة رئيسية تقيّد الأداء الكلي.
في ختام هذا المقال، يعكس معيار CrossModalQA أهمية التطور في عالم الذكاء الاصطناعي وكيف يمكن أن يسهم في الدفع نحو تحسين استجابات الأنظمة الآلية. ما رأيكم في هذا التطور؟ شاركونا في التعليقات.
ثورة في عالم الذكاء الاصطناعي: جسر الفجوة بين النصوص والصور مع CrossModalQA!
ت introduces CrossModalQA كمعيار جديد لتحسين أداء نماذج الاسترجاع المعزز متعدد الوسائط. مع 1863 زوج من أسئلة وأجوبة، يعد هذا المعيار طفرة في فهم الكيفية التي يتفاعل بها النص مع الصور.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
