في دراسة جديدة نُشرت على موقع arXiv، تم تقديم تقنية FastE الثورية التي تهدف إلى تحسين كفاءة نماذج اللغات الضخمة (LLMs) عن طريق تقليل العمق المتوقع للتكلفة. يركز البحث على مشكلة تكرار البادئة المعتمد على العمق في نماذج التضمين مثل Qwen3-Embedding وQwen3-VL-Embedding.

أظهرت النتائج أن إزالة حالات البادئة في الطبقات السطحية قد تكون أكثر ضرراً من الطبقات العميقة، مما يسمح بتحقيق Compressibility أكبر أثناء انتقال البادئات وحالات القراءة عبر الشبكة.

تأتي FastE كطريقة بسيطة وسهلة الاستخدام، حيث تعتمد على عتبة ثابتة مشتركة لضبط محاذاة البادئات مع متوسطات الدفعات، ما يجعلها أسلوباً خفيف الوزن لاختيار متى يتم تنفيذ الضغط. كما يتم تصنيف حالات البادئة بناءً على الدرجات التي تتلقاها من موضع القراءة.

أظهرت التقييمات فعالية FastE في تقليل التكاليف الحاسوبية؛ على سبيل المثال، أدت إلى تقليل FLOPs الخاصة بـQwen3-Embedding-0.6B بمعدل 40.11%، مع الحفاظ على 99.53% من DGC@10.

بفضل قابلية تخصيص التوازن بين الجودة والكفاءة، تظهر FastE إمكانيات كبيرة لتوليد التضمين القابل للتوسع في أنظمة الاسترجاع والفهرسة والتجميع والتمثيلات متعددة الوسائط.

في الختام، يمثل FastE خطوة هامة نحو تحسين البرمجيات المستخدمة في العديد من التطبيقات العملية في مجال الذكاء الاصطناعي. ما رأيكم في هذه التقنية الجديدة؟ شاركونا آرائكم في التعليقات!