تعتمد نماذج الرؤية واللغة (Vision-Language Models) على حجم كبير من الرموز البصرية مما يؤدي إلى تكاليف مالية وذهنية عالية. تكمن المشكلة التقليدية في أن الأساليب الحالية للتقليص تواجه صعوبة في تحقيق التوازن بين الحفاظ على المعاني العالية والتفاصيل الدقيقة. هنا يأتي دور تقنية HTC-VLM، الإطار الهجين لتقليص الرموز البصرية الذي يعمل على فصل الدلالات عن المظهر بدعم من طريقتين متكاملتين.
تتحقق الطريقة المستمرة من الحفاظ على ميزات رقعة ViT (Vision Transformer) بالتفصيل، بينما توفر الطريقة المتقطعة نقاط دلالية باستخدام تقنيات MGVQ (Multi-Granularity Vector Quantization) ممثلة بأربعة رموز. يجمع الإطار بين كلا الطريقتين ليشكل تسلسلًا هجينًا مكونًا من 580 رمزًا، يتم ضغطه إلى رمز واحد باستخدام ماسك انتباه لفصل المكونات وفتحة ضيقة.
من خلال الميزانية المعتمدة على رمز واحد، تحقق HTC-VLM معدل احتفاظ بالأداء يبلغ 87.2% عبر سبع معايير مختلفة (مثل GQA وVQAv2 وMMBench وMME). هذه الإحصاءات تتفوق على الأساسيات المستمرة الرائدة بمعدل 81.0%. تظهر تحليلات الانتباه أن الرمز المضغوط يركز على النقاط الدلالية، مما يدعم دورها في تقديم التوجيه الدلالي.
نواصل دراسة تأثير الميزانية الرمزية على التوسع، وعموم العمارة المعمارية، وكفاءة الاستدلال، ومرونة نظام الرموز والتغييرات، بالإضافة إلى الخصائص المعلوماتية للفتحة الهجينة. تظهر النتائج أن دمج ميزات الشكل المستمرة مع النقاط الدلالية المتقطعة يمكّن من تقليص فعال للرموز البصرية لتحقيق كفاءة استثنائية في نماذج الرؤية واللغة.
ثورة في عالم الذكاء الاصطناعي: تقنية HTC-VLM لتقليص رموز الصور بجودة عالية!
تقدم تقنية HTC-VLM نهجًا مبتكرًا لتقليل رموز الصور في نماذج اللغة والرؤية، مما يحسن الكفاءة بدون فقدان التفاصيل الهامة. استعد لدخول عصر جديد من الذكاء الاصطناعي وكفاءة الأداء!
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
