في عالم الذكاء الاصطناعي، تعتبر القدرة على الاستدلال التمثيلي جانباً أساسياً من جوانب الإدراك البشري، حيث تتمثل هذه القدرة في رسم العلاقات بين أزواج متعددة من الكائنات. ومع ذلك، لم تتمكن التقييمات الحالية المتعلقة بهذا النوع من الاستدلال في نماذج اللغة متعددة الوسائط (Multimodal Large Language Models) من تغطية القدرة على تركيب القواعد من مصادر عدة، وهو عنصر حيوي لفهم الذكاء المتقدم.
لتجاوز هذه الفجوة المعرفية، قدم الباحثون معيار CARV (Compositional Analogical Reasoning in Vision)، الذي يعكس مهمة جديدة مصحوبة بمجموعة بيانات تتكون من 5,500 عينة. حيث تمتد هذه المهمة من التعامل مع زوج واحد من الكائنات إلى أزواج متعددة، مما يستدعي من النماذج استخراج القواعد الرمزية من كل زوج لتكوين تحويلات جديدة.
عند تقييم الأداء، تبين الفجوة الكبيرة في الدقة، حيث حقق نموذج Gemini-2.5 Pro نسبة دقة 40.4% فقط، وهو أداء بعيد عن المستوى البشري الذي يصل إلى 100%. كما أظهر التحليل التشخيصي أن هناك نمطين دائمين من الفشل: الأول هو صعوبة تفكيك التغيرات المرئية إلى قواعد رمزية، والثاني هو الحفاظ على القوة والقدرة على التعاطي تحت ظروف متنوعة أو معقدة.
مع تقدم الأبحاث في هذا المجال، يبقى CARV معياراً مهماً لفهم حدود وعي الذكاء الاصطناعي في الاستدلال التمثيلي، مما يفتح المجال أمام مزيد من الابتكارات والتطورات في تصميم نماذج الذكاء الاصطناعي التي تحاكي الإدراك البشري بشكل أفضل.
ما رأيكم في هذا التطور؟ شاركونا في التعليقات!
CARV: معيار تشخيصي جديد لتقييم القدرة على الاستدلال التمثيلي في نماذج اللغة متعددة الوسائط!
تقدم دراسة جديدة معيار CARV، الذي يساعد على تقييم قدرات الاستدلال التمثيلي في نماذج اللغة متعددة الوسائط (MLLMs). على الرغم من استخدام Gemini-2.5 Pro لهذه المهمة، إلا أنه لا يزال بعيداً عن أداء الإنسان.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
