تعتبر دقة الكشف ثلاثي الأبعاد (3D Detection) أمرًا بالغ الأهمية للجهات المتنقلة المتمثلة في الروبوتات والأجهزة الذكية. وفي هذا السياق، تأتي نماذج رؤية الأساس (Vision Foundation Models - VFM) لتكون أداة مثالية وذلك لأنها توفر معلومات بصرية وهندسية قابلة للنقل. ومع ذلك، تعاني أجهزة الكشف عن 3D القائمة على نموذج VFM من الاعتماد على صور فردية بزاوية ضيقة أو مناظير منظور منفصلة، مما يقيد إدراك المشاهد المحيطة بشكل متماسك.

في هذا الصدد، تقدم OmniAct3D، إطار عمل ثوري يتكيف مع أجهزة الكشف المدربة مسبقًا على المنظور بينما يحافظ على مزايا نموذج VFM القابلة للنقل. بتقديم تقنية البروجيكشن الإكويكتانغولار (equirectangular projection - ERP) التي تشفر مشهدًا دائريًا (360 درجة) في صورة واحدة، يتيح ذلك معالجة معلومات الهندسة وتأثير الصور بشكل سليم.

والأهم من ذلك، تعالج OmniAct3D عدم التوافق الهندسي من خلال محول هندسة ERP-Ray (ERP-Ray Geometry Adapter)، الذي يقوم بنمذجة الأشعة البصرية الكروية وبنية الفضاء الدورية. كما أن سلسلة التفكير البصري-الحركي (Visual-Action Reasoning Chain - VARC) تعمل على توطين الأدلة في سياق المشهد الواسع، مما يحول كل فرضية إلى إجراء هندسي منظم.

تظهر التجارب أن OmniAct3D تزيد من أداء أفضل جهاز كشف ثلاثي الأبعاد بنسبة 2.96 نقطة NDS على قاعدة بيانات Spheriverse، وتتجاوز نقطة المقياس الموزون غير المعدل VFM بـ 24.87 نقطة على PanoMMOcc. تشير نتائج VARC إلى الحفاظ على 95-98% من المقياس الموزون نفسه في جميع التكوينات، مما يدل على إمكانية إعادة استخدام reasoning ثلاثي الأبعاد على مستوى الكائنات.

ستكون الكود المصدري متاحًا للجمهور عبر GitHub، مما يفتح المجال أمام مزيد من الابتكارات والتطويرات في مجال الكشف ثلاثي الأبعاد.