يعد الذكاء المكاني مهارة أساسية في عدة مجالات، مثل العلوم والتكنولوجيا والهندسة والرياضيات (STEM) والطب والهندسة المعمارية والبناء. ومع ذلك، أظهرت الدراسات الحديثة أن نماذج اللغة والرؤية (Vision-Language Models - VLMs) لا تزال تواجه تحديات في مجال التفكير المكاني، مما يعيق أداء الذكاء الاصطناعي (Artificial Intelligence - AI) في المهام المكانيّة العملية.
في تجربة جديدة، تم استخدام مجموعة بيانات متعددة لتدوير الكائنات كأداة للتدريب والتقييم، مما أظهر تحسناً واعداً في قدرة النظام على تحديد الدورانات في كلٍ من الفضاء الثنائي والثلاثي الأبعاد. نموذج Gemma-4 من شركة Google DeepMind، المزود بنموذج خلط الخبراء (Mixture-of-Experts - MoE)، حقق أداءً متفوقاً بكثير على النماذج العامة لـ Gemma-4 في توقع الدورانات المعتمدة على محاورها وزواياها.
علاوة على ذلك، أدت عملية تحسين النموذج (Fine-tuning) إلى تعزيز كبير في تقدير الزوايا لتمثيل ثنائي الأبعاد، دون الحاجة إلى نظام إحداثي صريح. وبدلاً من ذلك، أظهرت التجارب أن الأجسام القابلة للتعريف لم تُحسن دقة اكتشاف الزوايا، لكن الأجسام التي تحتوي على ميزات خطية بارزة هي التي أظهرت أداءً محسنًا.
هذه النتائج تسلط الضوء على أهمية تطوير الذكاء المكاني في الذكاء الاصطناعي، مما يفتح آفاقاً جديدة للتطبيقات في مجالات متنوعة. ما رأيكم في هذا التطور؟ شاركونا في التعليقات.
تحسين الذكاء المكاني للذكاء الاصطناعي: كيف تعزز نماذج اللغة والرؤية (VLM) من فهم الدوران الثنائي والثلاثي الأبعاد؟
أعلنت دراسة جديدة عن تحسين كبير في أداء نماذج اللغة والرؤية (VLM) في مهام الذكاء المكاني. هذا التطور يمكن أن يفتح آفاق جديدة لتطبيقات الذكاء الاصطناعي في مجالات متعددة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
