قامت دراسة جديدة تحت عنوان PolyComp بتقديم معيار مبتكر يقيس قدرات النماذج الذكية في التعامل مع التحديات المتعلقة بالمنطق المكاني ثلاثي الأبعاد. هذا المعيار يتميز بتوليد مشكلات مكونة من مجسمات "بوليكوب" (Polycube) والتي تتطلب من النماذج تحديد أي من الخيارات الأربعة توفر مزيجًا من مكونات معينة لتشكيل جسم هدف.

تتضمن مجموعة التحديات 120 مشكلة موزعة عبر أربع عائلات هندسية، حيث يتم تقديم كل مشكلة بصيغ متعددة يمكن أن تشمل صورة واحدة أو صور متعددة. الوضعيات المتاحة تأتي مع معدل توقع عشوائي قدره 25%. وفقًا للنتائج، فإن نموذج GPT-5.6 Sol باستخدام أقصى جهد حقق دقة 50.0%، بينما حقق نموذج Claude Fable 5 دقة 39.4% ونموذج Gemini 3.1 Pro Preview دقة 27.5%، مما يُظهر تباين في الدقة بين العائلات الهندسية المختلفة.

علاوة على ذلك، في المجمل، تم حساب تكلفة الأداء لكل نموذج، حيث كانت تكلفة نموذج GPT-5.6 هي الأعلى، لكنها أيضًا كانت الأكثر دقة. هذه النتائج تشير إلى الحاجة الملحة للتقدم في تطوير نماذج تعلم الآلة القادرة على فهم السياقات الهندسية المعقدة بشكل أفضل.

نستعرض هنا مجموعة من المشكلات التي تم تطويرها وتقييمها وفق بروتوكولات دقيقة، ونمنح الباحثين والمطورين فرصة التعرف على تفاصيل عمل PolyComp.