تقدم نماذج اللغات الضخمة (LLMs) إنجازات مثيرة في عالم الذكاء الاصطناعي، ولكن الزيادة المستمرة في سعتها تتطلب طاقة حسابية وذاكرة هائلة أثناء العمل. هنا يظهر دور تقنية التقطير المعرفي (Knowledge Distillation) التي توفر حلاً فعّالاً من خلال نقل المعرفة من نموذج كبير (المعلم) إلى نموذج أصغر (الطالب) عبر محاذاة توزيعات الاحتمالات.

ومع ذلك، تعتمد طرق التقطير المعرفي الحالية بشكل رئيسي على تقييم فروقات تستخدم قيم الاحتمال لكل مؤشر في المفردات، دون الاستفادة الكاملة من المعلومات الدلالية على مستوى الرموز. هنا تقدمت دراسة جديدة تُعرف باسم WASD، والتي تعتمد على مسافة واسيشتاين (Wasserstein) - وتعتبر طريقة مبتكرة في التقطير المعرفي.

تدمج تقنية WASD المعلومات الدلالية على مستوى الرموز باستخدام مسافة واسيشتاين، مستفيدة من مصفوفة تكاليف مشتقة من تمثيلات الرموز. لضمان قابلية الحساب، اعتمدنا انحراف سنكرون (Sinkhorn divergence)، الذي يمكن تحسينه بشكل فعال دون الحاجة إلى إدخال شبكات إضافية.

أظهرت التجارب عبر عدة عائلات من نماذج اللغات الضخمة مقاييس تحسين مستمرة في أداء تقنيات التقطير في مهام متنوعة تشمل الالتزام بالتعليمات، التفكير الرياضي، وتوليد الأكواد. تسلط نتائجنا الضوء على أهمية المعلومات الدلالية المشفرة في فضاء الرموز لتحقيق توزيع فعال في تقنيات التقطير.

إذا كنت مهتمًا بالتقنيات الجديدة في مجال الذكاء الاصطناعي، يمكنك الاطلاع على التنفيذ العام لهذه الطريقة عبر الرابط: WASD GitHub. ما رأيكم في هذا التطور في الذكاء الاصطناعي؟ شاركونا في التعليقات!