في عالم الذكاء الاصطناعي المتطور، تواصل نماذج اللغات الكبيرة متعددة الأنماط (MLLMs) تحقيق إنجازات مذهلة في مجالي التعرف البصري والفهم الدلالي. ولكن، يبقى التحدي في التفكير المكاني المركب تحت القيود الهندسية غامضًا ويحتاج إلى استكشاف أعمق. غالبية المعايير الحالية تركز على تقييم العلاقات المكانية الخشنة، مما يقيد إمكانية التحقق الهندسي الصارم أو وجود حلول متعددة صحيحة في المهام الإبداعية.
لمواجهة هذه القيود، نقدم لكم لعبة تانغرام (TangramPuzzle)، معيارًا جديدًا يتضمن 668 تكوينًا موثوقًا و1,336 حالة لتقييم التفكير المكاني المركب ضمن القيود الجيومترية.
قمنا بصياغة تعبير بناء تانغرام (TCE) لتشفير تكوينات تانغرام مع مواصفات جيومترية يمكن التحقق منها بواسطة آلة، بالإضافة إلى مدقق واعي للعديد من الحلول يقيم على حدة صحة الأبعاد ومطابقة الشكل.
تغطي لعبة تانغرام مهمتين تقييميتين متكاملتين: توقع الخطوط من الجزء إلى الكل (Outline Prediction) وتوليد التجميع من الكل إلى الجزء (End-to-End Assembly Generation).
من خلال إجراء تجارب تقييم شاملة على نماذج مفتوحة المصدر ونماذج خاصة، كشفنا عن اكتشاف مثير: تميل نماذج MLLM إلى إعطاء الأولوية لمطابقة الشكل المستهدف، مع إهمال القيود الهندسية، مما يؤدي إلى تشوهات أو تحريفات في القطع.
في ظل هذا التطور المذهل، يبقى السؤال: كيف يمكن لتقدم تقنية تانغرام أن يؤثر على مستقبل الذكاء الاصطناعي والتفاعل بين الإنسان والآلة؟ شاركونا آراءكم في التعليقات!
لعبة تانغرام: ثورة في تقييم نماذج اللغات الكبيرة متعددة الأنماط من خلال التفكير المكاني المركب!
تسجل نماذج اللغات الكبيرة متعددة الأنماط (MLLMs) تقدمًا ملحوظًا في فهم الصور، لكن التحدي لا يزال قائمًا في التفكير المكاني المركب. نقدم لكم لعبة تانغرام كمعيار يفتح آفاقًا جديدة في هذا المجال.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
