في عالم الذكاء الاصطناعي الذي يتطور بسرعة، يتطلب تحسين الأداء لأحدث نماذج اللغة الكبيرة (Large Language Models) نهجاً مبتكراً وفعالاً يقلل من العمليات الحسابية غير الضرورية. يطرح الباحثون إطار ACE (Adaptive Calibration-Free Expert Skipping) كحل مبتكر لمشكلة نماذج Mixture-of-Experts (MoE) التي تعاني من كثرة الحسابات الزائدة بسبب تفعيل عدد ثابت من الخبراء لكل توكن.

تعتمد العديد من طرق تخطي الخبراء الحالية على قياسات الثقة أو البيانات المخصصة للتدريب، مما يجعلها غير قادرة على تقدير الإسهامات الحقيقية للخبراء بطريقة موثوقة. هنا يأتي دور ACE الذي يقوم بتقديم طريقة جديدة لا تحتاج إلى تدريب إضافي أو معايرة، مع الاحتفاظ بالتحسينات في الأداء. يتكون إطار ACE من مكونين رئيسيين:

1. **الوسيط الطيفي العالمي (Global Spectral Proxy)**: الذي يقدّر القدرة العالمية على التحويل من خلال عمليات الربط المتعددة.
2. **تحسين التوجيه المخصص للخبير (Router-Conditioned Refinement)**: الذي يقوم ببناء نماذج توجيه خاصة بالخبراء من وزن التوجيه المركز.

خلال مرحلة الاستدلال، يجمع ACE بين التقديرات المختلفة مع بوابات التوجيه الديناميكية، بحيث يتم تخطي الخبير فقط عندما تشير التقديرات إلى مساهمة منخفضة، مع الحفاظ دائماً على الخبير الأفضل.

عبر مجموعة شاملة من التجارب على ثلاثة نماذج MoE وثمانية معايير، أثبتت ACE أنها تتفوّق باستمرار على الأساليب التقليدية، مع تحسين القياسات مثل انخفاض نسبة اللغز في WikiText-2 وتحسين دقة الأداء downstream بنقاط مئوية تصل إلى 4.15.

هل تعتقد أن هذه الابتكارات ستحدث ثورة في مجال الذكاء الاصطناعي؟ شاركونا آرائكم في التعليقات!