مع تقدم أنظمة الذكاء الاصطناعي، تظهر نماذج اللغات الكبيرة المتعددة الوسائط (OmniLLMs) كقوة ثورية في فهم النصوص، الصوتيات، والفيديو. ومع ذلك، فإن تسلسل الرموز الطويلة في الصوتيات والفيديو يسبب ارتفاعًا ملحوظًا في تكاليف الذاكرة والاستدلال.

تعتمد الأساليب الحالية للضغط بشكل أساسي على اختيار الرموز المهمة ضمن ميزانيات محددة مسبقًا، مما يهمل معظم التحديات المتعلقة بتخصيص الميزانيات. وفي هذا السياق، تقدم أومي دلتا (OmniDelta) كإطار عمل فريد يعتمد على المهارات ويعمل دون الحاجة إلى التدريب، حيث يدمج بين تخصيص الميزانية بين الأنماط المختلفة وتخصيص الميزانية داخل كل نمط.

تبدأ أومي دلتا بإنشاء مجموعات مهارية للصوت والفيديو، مما يتيح لها تغيير الميزانية المعتمدة على الرموز المحتفظ بها وفقًا لطبيعة الطلب على الاستفسارات. يعتمد الإطار على إعادة تخصيص الميزانيات بين المقاطع الصوتية وإطارات الفيديو باستخدام التعقيد المحلي والازدواجية الزمنية.

أظهرت التجارب على أربعة معايير صوتية وفيديو مختلفة مع نموذجين من Qwen2.5-Omni أن أومي دلتا قد أسست جبهة جديدة من الدقة والكفاءة عبر نسب تقليم مختلفة. فعلى سبيل المثال، في حال الاحتفاظ بـ 25% من الرموز في نموذج Qwen2.5-Omni-7B، تمكنت أومي دلتا من تقليل ذاكرة GPU بنسبة 22.0% وتحقيق زيادة في السرعة بمعدل 1.64 مرة مقارنة بالاستدلال الكامل.