في عالم الذكاء الاصطناعي، حيث تتسارع التطورات باستمرار، برزت نماذج اللغة الرؤية (Vision-Language Models - VLMs) كأدوات قوية تقدم قدرات مذهلة في الفهم والتفكير. ولكن، لا تزال تحديات الفهم الثلاثي الأبعاد قائمة. بدلاً من توسيع هذه النماذج التقليدية إلى ثلاثي الأبعاد بشكل مباشر، اتخذ الباحثون نهجاً مبتكراً. من خلال استخدام مفهومين جديدين: الإطار الإحداثي الكانوني (Canonical Coordinate Framing - CCF) والتغذية الراجعة التكيفية المتعلقة بالمهام (Task-Adaptive Feedback - TAF)، تمكنوا من تطوير نماذج VLMs تعمل بشكل موثوق في البيئة الثلاثية الأبعاد.

تعمل تقنية CCF كإطار مرجعي موحد يربط بين مدخلات البيانات ومخرجاتها في نظام إحداثيات إقليدي مشترك، مما يساعد في حل التحديات الشائعة مثل غموض المحاور وعدم اتساق المقاييس. وبالتوازي مع ذلك، تسهم TAF في إغلاق حلقة التفكير من خلال تغذية راجعة ديناميكية تساعد النماذج على أداء المهام المتنوعة بشكل مفتوح.

نتيجة لهذا الدمج بين CCF وTAF، تم تقديم '3D-Prog'، وهو إطار لفهم وتفكير وتوليد بيانات ثلاثية الأبعاد، يعمل على تحويل نماذج 2D VLMs إلى مبرمجين ثلاثيي الأبعاد يدركون الهندسة. هذا الإطار لا يتطلب أي إعادة تدريب، ويحقق نتائج متسقة وعالية الجودة عبر المهام الثلاثية الأبعاد المختلفة.