يشهد العالم الحالي نمواً متسارعاً في تطبيقات الذكاء الاصطناعي، وخاصة تلك التي تحتاج إلى القدرة على التفكير المكاني عبر خطوات متعددة، مثل التحكم في الروبوتات، قيادة السيارات ذاتية القيادة، وتجميع العناصر تلقائياً. ومع ذلك، لا يزال مدى قدرة نماذج اللغات المتعددة (Multimodal Large Language Models - MLLMs) على تحقيق هذا النوع من التفكير غير مستكشف إلى حد كبير.
لدراسة هذه القدرات، تم تقديم معيار جديد يسمى LEGO-Puzzles، الذي يستند إلى لعبة LEGO الشهيرة، والتي تتطلب مهارات تفكير مكاني متطورة. يتكون LEGO-Puzzles من مجموعتين من المهام: المجموعة الأولى تشمل 11 مهمة تتعلق بالأسئلة والأجوبة البصرية (VQA) مع 1,100 عينة مصممة بعناية لاختبار المهارات الأساسية في التفكير المكاني اللازمة لتجميع LEGO. أما المجموعة الثانية، فهي تتطلب من النموذج توليد خطة خطوة بخطوة لتجميع هيكل LEGO معين، مع تنظيم المهام في مجموعات فرعية تمتد حتى 8 خطوات تخطيطية.
تشير التقييمات التي تم إجراؤها على 29 نموذجاً متقدماً من MLLMs إلى أن هذه النماذج، حتى الأقوى منها، تعاني من ضعف في أداء المهام الأساسية المتعلقة بالتحليل المكاني، حيث تقل نتائجها بما لا يقل عن 20% عن أداء البشر. كما تنخفض دقة التخطيط بسرعة إلى 0% مع زيادة عدد الخطوات المطلوبة في التخطيط، بينما يتمكن المشاركون البشريون من حل جميع المهام بشكل مثالي.
علاوة على ذلك، عندما تم تغيير صيغة الإخراج من خيارات متعددة إلى توليد الصور، انخفض أداء النموذج أكثر، ليصل إلى دقة صفر حتى في التخطيط لثلاث خطوات. تكشف LEGO-Puzzles عن قيود هامة في قدرات نماذج MLLMs الحالية في التفكير المكاني، مما يسلط الضوء على الحاجة إلى تطورات كبيرة لتحسين الأداء.
في نهاية المطاف، هذه الدراسة لا تبرز فقط الفجوات في الأداء، بل تدعو أيضاً الباحثين والمطورين نحو إيجاد حلول مبتكرة لتجاوز هذه التحديات.
استكشاف حدود الذكاء الاصطناعي: كيف تقيم نماذج اللغات المتعددة مهارات التفكير المكاني المعقدة؟
تقدم LEGO-Puzzles معياراً جديداً لتقييم قدرات الذكاء الاصطناعي في التفكير المكاني متعدد الخطوات. النتائج تكشف عن فجوات كبيرة في أداء نماذج اللغات الضخمة، مما يدعو المجتمع التكنولوجي للبحث عن تحسينات جوهرية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
