في عالم الذكاء الاصطناعي، يبدو أن التعلم المتعدد المهام (Multi-Task Learning - MTL) يمثل خطوة ثورية في فهم الأنظمة الروبوتية للمشاهد ثلاثية الأبعاد. مع تزايد الاعتماد على نماذج الرؤية الأساسية (Vision Foundation Models - VFMs)، تظهر الحاجة الملحة إلى استراتيجيات فك الترميز الفعالة.

هنا يأتي دور DPNeXt، وهو إطار عمل معزز يجمع بين ميزات متعددة لتقديم خيار أفضل وأكثر كفاءة مقارنة بالنموذج القياسي لنظام Dense Prediction Transformer (DPT). يتميز DPNeXt باستخدامه لـ "اختناقات معكوسة قابلة للفصل"، مما يعزز الاستفادة من VFMs المتجمدة من خلال فك ترميز مركزي يرتكز على الدمج.

علاوة على ذلك، تم تقديم استراتيجية توجيه حدود المهام المتعددة (Multi-Task Boundary Guidance - MTBG)، حيث تركز هذه الاستراتيجية على تحسين التناسق الهندسي دون الحاجة إلى تكلفة إضافية للتعليق أو الاستدلال. وتشير التجارب التي أُجريت على مجموعة بيانات Cityscapes إلى أن DPNeXt-S يتفوق على النماذج الحالية الرائدة في الأداء. بينما يحقق DPNeXt-B تحسينات إضافية ملحوظة.

بالإضافة إلى ذلك، في مجموعة بيانات NYUv2، يأتي DPNeXt-B كأفضل نموذج في تصنيف الكيانات الكبيرة والتقدير العمقي، متفوقًا على أقرانه في الكفاءة من حيث عدد المعلمات القابلة للتدريب. مقارنةً بالنموذج القياسي DPT، يقلل DPNeXt-S عدد هذه المعلمات بنسبة 78.6% ويحقق أسرع سرعة استدلال على أجهزة الكمبيوتر المحمولة ذات الموارد المحدودة.

للمهتمين بالاكتشاف، سيتوفر الكود المصدري ونقاط النموذج وفيديو توضيحي على https://github.com/kangjehun/DPNeXt. يُشير DPNeXt إلى مستقبل مثير لأنظمة الذكاء الاصطناعي، ويبرز القوة المذهلة للتعلم المتعدد المهام في فهم العالم ثلاثي الأبعاد.