في عالم الذكاء الاصطناعي، خاصةً نماذج اللغات الضخمة (Large Language Models)، برزت الحاجة إلى تحسين أداء نماذج Mixture-of-Experts (MoE) لجعلها أكثر فعالية للاستخدام في الأجهزة الطرفية. تعتبر هذه النماذج جذابة لأنها تعتمد على تشغيل مجموعة محدودة من الخبراء فقط لكل توكن، ولكن غالباً ما تواجه مشكلة في تجاوز أوزان الخبراء الذاكرة المتاحة في المسار المعجل.

في الآونة الأخيرة، تم تقديم إطار عمل جديد يُدعى DraftExpert، والذي يهدف إلى معالجة القيود الموجودة في تقنيات التحميل الذاتية في البيئات ذات التأخير المنخفض. يعتمد هذا الإطار على فكرة أن تحسين مجموعة الخبراء يتطلب مزيداً من تحميل الخبراء، مما قد يؤدي إلى زيادة وقت الاستجابة. لذا، تقدم DraftExpert حلاً مبتكراً من خلال تدريب خبير خفيف الوزن لكل طبقة، ويتم ذلك باستخدام التقنيات المساعدة مثل تمييز البيانات (self-distilling) والإشارات المتفق عليها بين الموجهين.

عند مرحلة الاستدلال، تستخدم DraftExpert مجموعة من الإجراءات بذكاء، بما في ذلك استخدام مختصرات ثابتة وميزة تتبع الخبراء المستهدفين، مما يتيح لها أن تحسن متوسط عرض النطاق الترددي لعمليات الاستدلال بمعدل 1.45 ضعف، مع زيادة نسبة قبول التخمين إلى 84-87%. هذا الابتكار يعد إنجازاً مهماً في عالم الذكاء الاصطناعي، فهو يحسن كفاءة استخدام الموارد ويساهم في تقديم نتائج دقيقة ومُرضية.

مع هذه التحسينات، يتوقع استخدام DraftExpert في التطبيقات العملية بشكل واسع، مما سيمهد الطريق لمزيد من الابتكارات في عالم التكنولوجيا الذكية.