في عالم الذكاء الاصطناعي الحديث، أصبحت نماذج اللغات الضخمة (Large Language Models) أساسية في تطوير العديد من التطبيقات والخدمات. ومع ذلك، فإن تكلفة استدلال هذه النماذج العالية تمثل تحديًا كبيرًا. يقدم الباحثون الآن تقنية جديدة مثيرة تُعرف بـ Weight-Redundancy Pruning (WRP) والتي تعتمد على إزالة العمق من النماذج بطريقة مبتكرة.

تعمل تقنية WRP على تقليل تكلفة استدلال نماذج Transformer من خلال إزالة كتل كاملة بدلاً من الاعتماد على طرق بيانات المعايرة المعقدة. وعلى عكس الطرق السابقة، التي قد تتطلب تشغيل النموذج على بيانات إضافية، تتمكن WRP من تقدير تكرار الأوزان بين الطبقات مباشرة من البيانات المخزنة (checkpoint weights).

تقوم الطريقة الجديدة بمقارنة أوزان نتائج الانتباه (attention output) وأوزان تخفيض MLP عبر الطبقات، لدمج تشابهات هذه الأوزان مع معلومات النسبة النسبية. وبفضل هذه المقارنة، يتم إنتاج مصفوفة تشابه تحدد كيفية تجميع الطبقات واختيار الكتل، مما يعزز الأداء.

تُظهر الدراسات التجريبية أن WRP تتفوق في الأداء على أساليب إزالة العمق التقليدية، و تقترب من فعالية الطرق المستندة إلى بيانات المعايرة. هذا الابتكار يمكن أن يكون له آثار بعيدة المدى على كيفية استخدام نماذج الذكاء الاصطناعي في المستقبل.

هل أنتم متحمسون لرؤية كيف ستؤثر هذه التقنية على تطوير نماذج اللغات الضخمة؟ شاركونا آرائكم في التعليقات!