في ظل النمو المتزايد لحجم نماذج اللغات الضخمة (LLMs)، يبرز الضغط الفعال كخيار ضروري لتقليل الأعباء الحاسوبية واحتياجات الذاكرة. ومع ذلك، تعاني الطرق الحالية من مشكلات كبيرة، حيث إن زيادة نسبة الضغط تؤدي غالباً إلى تدهور كبير في الأداء. من بين الطرق الشائعة في عملية الضغط تتواجد خوارزمية التحلل منخفض الرتبة (Low-rank Decomposition) والتكميم (Quantization)، والتي أثبتت فعاليتها في تقليل متطلبات المعالجة والذاكرة مع الحفاظ على دقة النموذج.

لكن السؤال الحاسم يبقى: كيف تتفاعل هاتان الطريقتان عند دمجهما؟ الكثير من المطورين افترضوا أن هذه الطرق غير متقاطعة (Orthogonal)، مما يعني أن دمجها لن يتسبب في أخطاء إضافية. ولكن، دراسة جديدة تسلط الضوء على هذا الأمر: إذ تقدم الدليل الرياضي الأول على أن التحلل منخفض الرتبة والتكميم هما في الواقع غير متقاطعين.

وقد أجريت تجارب على نماذج اللغات الضخمة لدعم هذه النتائج. أظهرت بيانات التجارب أن دمج هاتين الطريقتين يؤدي إلى تدهور ملحوظ في الأداء، مما يبرز أهمية فهم كيفية تفاعلها.

لذلك، تم اقتراح طريقة جديدة تُعرف باسم الأسلوب اللاصق القطرية (Diagonal Adhesive Method - DAM)، والتي يمكن أن تجمع بفعالية بين هاتين الطريقتين وتقلل من فقدان الأداء.

تأملات هذه الدراسة توفر رؤى عميقة حول ضغط النماذج وتؤسس لأساس نظري وتجريبي قوي لدراسات مستقبلية متعلقة بهذا المجال.