في عالم الذكاء الاصطناعي، تستمر الاكتشافات في صقل مهارات النماذج اللغوية وتقديم تحسينات هائلة. وآخر هذه الاكتشافات هو تقنيات استخلاص الكتل الصماء Gated Linear Unit (GLU) الخالية من الانحياز، والتي تشكل جزءًا أساسيًا في العديد من النماذج الحديثة.

لقد أظهرت الدراسات السابقة تقنيات الاستخراج للعديد من الأجزاء الأخرى في الشبكات العصبية، مثل شبكات ReLU والتفعيل العنصري مثل GELU وSiLU، ولكنها لم تتناول Kكتل GLU بالتفصيل. تتميز كتل GLU بتكوينها الفريد - حيث يتم ضرب تنشيط الإسقاط الخطي بواسطة إسقاط آخر متعلم داخل كل وحدة خفية، مما يعقد عملية الاستخراج.

في هذا السياق، تطورت تقنية استعادة متعددة المراحل تستند إلى استعلامات أمامية بالعزل للكتل الخالية من الانحياز. تم استخدام طريقة فرق نهائي لتوفير مرشحات اتجاه البوابة، حيث تتيح الملاحظات المقترنة عند x و-x فصل حجم البوابة واتجاهها.

عبر استهداف دقيق، أظهرت التجارب أن كتل GLU تستمر في تحقيق أخطاء متوسطة أقل من 1% في عدة بيئات اختبار، بما في ذلك ستة طبقات Qwen ومشكلة فرعية من Llama تحتوي على 8192 وحدة. ومع ذلك، لا تزال هناك تحديات قائمة، حيث لم تتمكن أي من العمليات الحالية من استنساخ جميع الأوزان المخزنة، مما يعني أن هذه التجارب ليست هجومًا يعتمد على نموذج واجهة برمجة التطبيقات الشاملة.

يدعونا هذا الاكتشاف للتفكير في كيفية تسريع تطور الذكاء الاصطناعي، وكيف يمكن أن تقدم هذه الخطوات الجديدة نظرية متينة لفهم أعمق لنماذج اللغة المعقدة.