في ظل التطور المستمر لنماذج اللغات الضخمة (LLMs)، أصبح من الضروري تطوير طرق تقييم فعالة تسلط الضوء على الفقد في الجودة الناتج عن ضغط النموذج. يعتمد نشر هذه النماذج على الأجهزة ذات الذاكرة المحدودة بشكل كبير على الضغط العددي بعد التدريب، لكن تقييم هذه النماذج كان يتوجه غالباً نحو دقة المهام دون النظر إلى التغيرات في توزيعات التنبؤ.

تكشف دراسة حديثة عن نهج جديد يستخدم تقييم يعتمد على تغييرات التوزيع بدلاً من دقة النتائج التقليدية. يعتمد هذا النهج على حساب المسافات الإحصائية مثل تقارب جبسن-شانون (Jensen-Shannon Divergence) والمسافة الكلية للتباين (Total Variation Distance) بين النماذج ذات الدقة العالية والنماذج المضغوطة، ما يسهل تحليل دقيق للتحولات التوزيعية.

أجريت التجارب عبر خمسة هياكل أساسية وأربعة معايير للتفكير، حيث أظهر تحليل النتائج أن القياسات المتعلقة بالتباين تميل إلى الزيادة مع زيادة مستوى الضغط، مما يضيف بُعداً جديداً لتحليل جودة النماذج.

تعتبر هذه النتائج مؤشراً هاماً على ضرورة تقييم يعتمد على الوعي بالتوزيع كخطوة عملية موازية لدقة المهام، وهو ما يساهم في تحسين الأداء العام للنماذج ويعزز الفهم الأعمق للتغيرات التي قد تحدث عند تنفيذ النماذج ذات الضغط العالي.