في عالم الذكاء الاصطناعي، تُعد نماذج الرؤية الثلاثية الأبعاد (3D Vision-Language Models - 3D VLMs) من أبرز الابتكارات التي أثبتت جدارتها في معالجة البيانات المرئية. ومع ذلك، تواجه هذه النماذج تحديًا كبيرًا يتمثل في ارتفاع عدد الرموز البصرية، مما يؤدي إلى ضغط حاد أثناء عملية الاستدلال.
عادات تقليص الرموز الموجودة تركز عادةً على زيادة التنوع، مما يؤدي إلى التخلص من رموز مشابهة لتعظيم التوزيع، ولكن في البيئات الثلاثية الأبعاد، قد يؤدي هذا النهج إلى فقدان الرموز النموذجية التي تمثل معلومات حيوية، مما يعطل التناسق متعدد وجهات النظر والهياكل الهندسية الضرورية.
لذلك، ابتكر الباحثون نموذج CoverPrune الذي يمثل تحولًا جذريًا في أساليب تقليص رموز الرؤية الثلاثية الأبعاد، حيث ينتقل من مفهوم تعظيم التنوع إلى الحفاظ على تغطية الأدلة البصرية.
يعتمد CoverPrune على صياغة عملية تقليص الرموز كمسألة نقل مثالي (Optimal Transport - OT)، مما يسهل تحديد الرموز الأكثر أهمية دون التسبب في فوضى في البيانات. وللتغلب على المفاضلة المعقدة الناتجة، تم تصميم تكلفة النقل Feature-Spatial-Temporal (FST) مع قدرة مستهدفة، إلى جانب خوارزمية اختيار جشع موجهة مكانيًا (Spatial-Guided Greedy Selection - SGS) تقترب من تحقيق هدف OT.
علاوة على ذلك، تم تقديم CoverPrune-Lite، وهو إصدار معجل يستفيد من المطابقة المحلية الهيكلية لتقليل الوقت المستغرق، مما يعزز كفاءة النماذج بشكل كبير. أظهرت التجارب الواسعة عبر مجموعة متعددة من المعايير البصرية الثلاثية الأبعاد أن هذه الطرق تحقق فعالية غير مسبوقة في تقليص الرموز، مع الحفاظ على أداء سريع حتى تحت ميزانيات تقليص صارمة.
للمزيد من التفاصيل حول هذه الابتكارات المثيرة، يمكنكم زيارة موقع المشروع على GitHub.
ثورة في نماذج الرؤية الثلاثية الأبعاد: تقنية CoverPrune لتقليل عدد الرموز بكفاءة مذهلة!
تمثل CoverPrune نقلة نوعية في تحسين كفاءة نماذج الرؤية الثلاثية الأبعاد، حيث تقدم حلاً مبتكرًا لتقليل أعداد الرموز أثناء الاستدلال. بفضل هذا التقليص، يمكن تحسين الأداء دون التضحية بجودة النتائج.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
