في عالم الذكاء الاصطناعي، تُعتبر القدرة على الاستدلال عبر المعلومات المرئية بمثابة قفزة نوعية تفتح آفاقًا جديدة لفهم البيانات. هذا هو ما يقدمه النموذج الجديد المعروف باسم

**Causal Visual Recurrent Reasoning (CVRR)**، الذي يهدف إلى تطوير آليات الاستدلال عبر المعلومات البصرية المخفية.


يعكس نموذج CVRR قدرة متطورة على إجراء استدلال متعدد الوسائط من خلال حساب الحالات المخفية بدلاً من الاعتماد على سلسلة نصية طويلة من الأفكار. ولكن ما يميز هذا النموذج هو أنه لا يعتمد فقط على الحالة الغامضة للإجابة، بل يستخدم أيضًا مسارات بديلة تعتمد على الصور.


حيث يبدأ CVRR بتفعيل حالة الاستقراء من السؤال بعد أن يقوم نموذج اللغة والرؤية المدرب مسبقًا بتكامل الصورة، ثم يقوم بتحديث هذه الحالة بشكل متكرر بالاستناد إلى نفس الأدلة البصرية الثابتة. وبدلاً من حفظ جميع المعلومات، يتم إزالة الحالات البصرية وسجل الذاكرة المتعددة الوسائط KV قبل فك التشفير، مما يضمن بقاء المعلومات الخاصة بالصور ضمن الحالة النهائية.


بالمقارنة مع معايير الأداء التقليدية مثل $V^*$ وMMVP وBLINK وMME-RealWorld-Lite، أثبت CVRR فعاليته العالية حتى تحت هذه الظروف المحكمة، في حين أن الحلول التقليدية لم تتمكن من استعادة الكفاءات البصرية المماثلة حتى عند إعادة تدريبها بنفس الالتزامات.


تكشف التدخلات السببية أيضًا أن التنبؤات تظل حساسة للمحتوى المتكرر عندما يبقى السؤال ثابتًا، مما يدل على أن الأدلة البصرية الثابتة تعدل المسار المتكرر. هذه النتائج تميز بين المعلومات الغامضة التي تُستخدم بشكل فعلي من قبل النموذج وعمليات الحساب المعتمدة عليها.


مستقبل الذكاء الاصطناعي يبدو مشوقًا مع التحسينات المستمرة في تقنيات الاستدلال، مما يجعل السؤال حول أهمية المعلومات المرئية في اتخاذ القرار أكثر إثارة. ما رأيكم في هذا الاتجاه الجديد؟ شاركونا في التعليقات!