في عالم الذكاء الاصطناعي، تعد نماذج اللغة المرئية (Vision-language Models أو VLM) ثورة حقيقية، حيث تمثل نقطة التقاء بين النصوص والصور. لكن، كيف يمكننا التأكد من أن هذه النماذج تنظم المعلومات بشكل دلالي صحيح؟ اليك ما توصل إليه البحث الجديد.

يتناول البحث إطارًا ما بعد تحليل (post-hoc) لفهم وتسوية التسلسلات الهرمية الدلالية (semantic hierarchies) التي تنشئها نماذج اللغة المرئية. في البداية، يستخرج الباحثون تسلسلًا هرميًا ثنائيًا عبر تجميع مراكز الفئات (class centroids)، ويستخدمون مطابقة مبنية على القاموس لتسمية العقد الداخلية. في الخطوة التالية، يتم تقييم مصداقية هذا التسلسل من خلال مقارنة الشجرة المستخرجة مع الأنطولوجيات البشرية، مما يسمح بتحديد مدى التناظر بين النتائج البشرية والنموذج.

الأكثر إثارة هو اكتشاف الفروق النظامية بين تشفيرات الصور وتشفيرات النصوص؛ حيث بينت النتائج أن تشفيرات الصور تتمتع بقدرة تمييز أعلى، بينما تشفيرات النصوص تميل إلى مواكبة التسلسلات الهرمية البشرية بشكل أفضل. يُظهر البحث التحدي المستمر بين دقة النماذج وفق مبدأ zero-shot والتوافق الدلالي، مما يمهد الطريق لتحسين الأداء في الفضاءات المشتركة.

في ختام هذا البحث، تم اقتراح طريقة جديدة لتوجيه الانطولوجيا لتحسين التوافق الدلالي، مما يدل على أن هناك العديد من السبل العملية للتقدم في هذا المجال. تظل نماذج اللغة المرئية عنصرًا مهمًا يجب فهمه بعمق لتحقيق أفضل النتائج.