يواجه الكثير من الباحثين تحديات متعددة عند محاولة تمديد تقنيات التشفير الاستباقي (Speculative Decoding) لتشمل نماذج الرؤية واللغة (Vision-Language Models). على الرغم من أن هذه التقنية قد أثبتت فعاليتها في تسريع استنتاجات نماذج اللغة الكبيرة (Large Language Models)، إلا أن بعض النتائج توضح أن الرموز البصرية في نماذج الرؤية واللغة الكبيرة تُظهر تكرارا كبيرا.
في ضوء هذه النتائج، تم تقديم الإطار HiViS (Hiding Visual Tokens from the Drafter for Speculative Decoding in Vision-Language Models)، الذي يهدف إلى إخفاء الرموز البصرية خلال عملية الاستنتاج، مما يسمح للمعالج (Drafter) بالحصول على المعلومات البصرية دون الحاجة لمعالجة الرموز البصرية.
تستند فكرة HiViS على مبدأ الدمج الدلالي، حيث يستخدم الإطار نموذج VLM المستهدف كنموذج دمج دلالي، مما يضمن توافق طول تسلسل المعالجة مع طول الرموز النصية.
إضافة إلى ذلك، يعتمد HiViS نهج تدريب متزامن يعتمد على الزمن، مما يمكن المعالج من تحسين الدلالات البصرية والنصية خلال عملية الاستنتاج بصورة مستقلة. تجارب موسعة على نماذج VLM ممثلة وأدوات قياس الأداء أثبتت أن HiViS يحقق تحسينات ملحوظة في متوسط طول القبول ونسبة السرعة.
تعتبر هذه التطورات نتاجًا للبحث والتطوير المستمر في مجال الذكاء الاصطناعي، مما يفتح أفقًا جديدًا للابتكارات المستقبلية.
ثورة الذكاء الاصطناعي: إطار HiViS يغير قواعد اللعبة في نماذج الرؤية واللغة!
تقدم تقنية HiViS حلاً مبتكرًا لتسريع استنتاجات نماذج الرؤية واللغة (VLMs) من خلال إخفاء الرموز البصرية. هذه الخطوة تعزز الكفاءة وتقليل الحاجة للمعالجة المتكررة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
