تُعد الهندسة Plane Geometry أحد أبرز التحديات التي تواجه الذكاء الاصطناعي، حيث تتطلب دمج الإدراك البصري (Visual Perception) مع التفكير الرياضي (Mathematical Reasoning). بينما تتعامل نماذج النماذج متعددة الوسائط الكبيرة (Large Multimodal Models) بشكل طبيعي مع المدخلات اللغوية البصرية، إلا أنها تكون غالبًا مكلفة حسابيًا وغامضة. في هذا السياق، نعرض طريقة جديدة: نموذج لغة كبير (Large Language Model) مزود بوحدات متخصصة يمكن أن ينافس نماذج متعددة الوسائط في حل مشكلات الهندسة المعقدة.

تتضمن هذه الطريقة استخدام مُحلل الرؤية الهندسية (Geometric Vision Parser)، الذي يقوم بتحويل الرسوم البيانية إلى شكل رمزي، بالإضافة إلى مُحلل رمزي (Symbolic Solver) يقوم بإجراء الاستنتاجات الرسمية. هذا يساهم في تقليل الظواهر الغير منطقية (Hallucinations) وتعزيز القدرة على التفكير بشكل واضح ومفهوم.

لضمان تقييم دقيق، تم إنشاء مجموعة من المشكلات التحديّة المستمدة من امتحانات Zhongkao الصينية لعام 2025، مما يضمن تجديد البيانات واختبار المهارات الاستنتاجية العميقة.

تظهر التجارب أن هذا الإطار الجديد يحقق أداءً يقارن بمستوى نموذج Gemini 2.5 Pro، مع تقديم حلول أوضح ومرئية تقترب من التفكير البشري. إن الابتكارات المقدمّة هنا تفتح آفاقًا جديدة في كيفية التعامل مع المشاكل الهندسية ورسم المستقبل للذكاء الاصطناعي في مجالات متنوعة.