في خطوة تكنولوجية متقدمة، تمكن باحثون من تطوير نموذج QTEA الذي يُعد ابتكارًا جديدًا في مجال تقنيات نماذج اللغات الضخمة (Large Language Models). يوفر هذا النموذج حلاً فعالاً لتقليل الأعباء الحاسوبية المرتبطة بتشغيل هذه النماذج على مستوى كبير.

تعتمد تقنيات التحويل بعد التدريب (Post-Training Quantization) العادية على طرق قد تفشل في التعميم عبر النماذج وتؤدي إلى فقدان كبير في الدقة عندما يقل الحجم عن 2 بت. بينما تم استخدام الكثافة غير الهيكلية (Unstructured Sparsity) لتخفيف هذا الخسارة، فإنها تحمل معها تحديات في التوافق مع الأداء العالي على وحدات معالجة الرسوميات (GPUs).

الجديد في نموذج QTEA هو استخدام قيم ثلاثية (Ternary Values) لتقليص الأوزان، واستخدام الأوزان البارزة (Salient Weights) كتعويضات عن الأخطاء المتبقية. بالإضافة إلى ذلك، يقوم النموذج بتحسين الأداء من خلال استخدام نُظم فرعية (Semi-structured) في توزيع الأخطاء، مما يعزز من الكفاءة العامة للمعالجة.

أظهرت التجارب على نموذج Qwen3-14B أن QTEA تمكن من ضغط الأوزان إلى 1.7 بت لكل وزن، مما ساهم في تحسين معدل الدقة بمعدل 16.7% مقارنةً بأقوى نماذج تقليص الأوزان السابقة. ومع نموذج لاما (Llama3-8B)، تم تحقيق زيادة في الدقة بنسبة 6.6% وتحقيق تدني في التعقيد الإدراكي (Perplexity) على نفس البيانات.

توفر العملية الجديدة أيضًا كفاءة أكبر على صعيد سرعة الإنتاج لكل رمز، حيث استطاع الفريق أن يحقق سرعات تفوق 7.2 مرة مقارنة بنموذج FP16 السابق.

للمزيد من التفاصيل والتجارب، يمكنكم زيارة صفحة النموذج على GitHub.