تسعى الأبحاث الحديثة في مجال الذكاء الاصطناعي إلى تعزيز أداء نماذج اللغات المتعددة (MLLMs)، والتي تتميز بقدرتها الكبيرة على التعامل مع مجموعة متنوعة من المهام البصرية واللغوية. ولكن، تواجه هذه النماذج تحدياً كبيراً يتمثل في الكلفة العالية لمعالجة العديد من الرموز البصرية.
أحد الحلول المطروحة هو تقليل عدد الرموز البصرية من خلال تقنية تُعرف باسم "تنقية الرموز البصرية" (visual token pruning)، والتي تعتمد على تقديرات دقيقة لأهمية الرموز. وعلى الرغم من أن الدراسات السابقة أثبتت فعالية تقنية الانتباه من الطبقات المتوسطة لنماذج اللغات، فإن هناك معضلتين رئيسيتين لا زالتا قائمة.
الأولى هي أن الطبقة المسؤولة عن الانتباه تتغير بشكل كبير حسب البيانات المدخلة، مما يجعل الاعتماد على طبقة ثابتة أمراً غير مثالي. والثانية، تحتاج العملية التقليدية الحصول على انتباه الطبقة المناسبة من خلال معالجة العديد من الرموز البصرية عبر عدة طبقات من النموذج، مما يستنزف الكثير من الموارد.
لمعالجة هاتين المشكلتين، تم اقتراح تقنية جديدة تُعرف باسم "تنبؤ الانتباه المتوسط" (Middle-layer Attention Prediction أو MAP). تعتمد هذه التقنية على اختيار طبقة توجيه معينة تتماشى مع نوع السؤال المطروح، مما يسمح بتقدير أهمية الرموز البصرية بطريقة أكثر تخصيصاً.
خلاصة للتجارب، أظهرت النتائج أن MAP تحتفظ بـ 97.5% من أداء النموذج الأصلي مع فقط 5.56% من الرموز البصرية، مما يحقق زيادة في السرعة تصل إلى 3.09 مرة خلال التنفيذ. هذه الكفاءة والتحسينات المُقترحة تمثل خطوة هامة للأمام في مجال البحث والتطوير لنماذج اللغات المتعددة.
هل تعتقد أن هذه التقنية ستغير شكل الذكاء الاصطناعي كما نعرفه اليوم؟ شاركونا آرائكم في التعليقات.
كيفية تعزيز كفاءة نماذج اللغات المتعددة باستخدام تنبؤات الانتباه المتوسطة!
تقدم الأبحاث الحالية طريقة جديدة لتحسين أداء نماذج اللغات المتعددة من خلال تنبؤ الانتباه في الطبقات المتوسطة. هذه التقنية تعزز كفاءة معالجة الرموز البصرية وتحقق زيادة ملحوظة في السرعة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
