في عالم الذكاء الاصطناعي، تظهر نماذج الرؤية-اللغة (Vision-Language Models) كأدوات قوية لفهم اللغة وتحليل الصور. ومع ذلك، تعاني هذه النماذج من قيود عند التعامل مع الفهم البصري الذي يتطلب قدرات إدراكية كثيفة، مثل التفكير المكاني والوعي الهندسي. هنا يأتي دور الابتكار الجديد: Chain-of-Visual-Thought (COVT).
تعتبر COVT إطارًا مبتكرًا يمكّن نماذج الرؤية-اللغة من التفكير ليس فقط من خلال الكلمات، بل أيضًا باستخدام رموز بصرية مستمرة توفر تمثيلات غنية للإدراك. الفكرة الرئيسية هي استخدام ما يقرب من 20 رمزًا بصريًا لجمع المعرفة من خبراء الرؤية بشكل مدمج، مما يساعد في التقاط خصائص تكملية تشمل الشكل ثنائي الأبعاد، والهندسة ثلاثية الأبعاد، والتوزيع المكاني، وبنية الحواف.
أثناء التدريب، تتنبأ نماذج VLM التي تستخدم COVT بشكل تتابعي بهذه الرموز البصرية لإعادة بناء إشارات إشراف كثيفة مثل العمق، والتقسيم، والحواف. وعند مرحلة الاستدلال، يُمكن للنموذج التفكير بشكل مباشر في فضاء الرموز البصرية المستمرة، مما يحفظ كفاءة الأداء مع إمكانية فك تشفير التنبؤات الكثيفة لفهم النتائج.
عند تقييمها عبر أكثر من عشرة معايير إدراك متنوعة، مثل CV-Bench وMMVP وRealWorldQA، أظهرت دمج COVT في نماذج VLM القوية مثل Qwen2.5-VL وLLaVA تصاعدًا ملحوظًا في الأداء يتراوح بين 3% إلى 16%. تثبت هذه النتائج أن التفكير البصري المستمر يمكّن من ذكاء متعدد الوسائط أكثر دقة ووضوحًا.
في ضوء هذا التطور المذهل، كيف ترى مستقبل نماذج الرؤية-اللغة وكيف يمكن أن تؤثر هذه التقنية عليها؟ شاركونا آرائكم في التعليقات!
تطور مذهل في الذكاء الاصطناعي: إطار Chain-of-Visual-Thought لتعزيز قدرات نماذج الرؤية-اللغة!
اكتشاف علمي جديد يُحدث ثورة في نماذج الرؤية-اللغة (VLMs) بفضل تقنية Chain-of-Visual-Thought. تتيح هذه التقنية للنماذج التفكير من خلال رموز بصرية مستمرة، مما يعزز قدرتها على الفهم البصري.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
