في عالم الذكاء الاصطناعي، تعتبر نماذج خلط الخبراء (Mixture-of-experts - MoE) من أبرز الابتكارات، وتتميز بقدرتها على تحسين الأداء عبر استخدام عدد كبير من المعلمات في نظام ذكي. لكن استنتاج MoE على الأجهزة الاستهلاكية يواجه تحديات جسيمة تتعلق بالذاكرة، خاصة عند التعامل مع نموذج يبلغ حجمه 35 مليار معلمة، حيث تتطلب هذه النماذج ذاكرة ثقيلة تصل إلى 19.5 جيجابايت عند استخدام تقنية التكميم ذات 4 بت.

تواجه هذه النماذج مفارقة، إذ أن البساطة في نقل المعلومات إلى وحدات التخزين ذات الحالة الثابتة (SSD) لا تحل المشكلة بمفردها، حيث يجب اختيار خبراء الطبقة التالية قبل أن تتاح نتائج الطبقة الحالية، مما يجعل من الصعب بداية القراءة في الوقت الكافي.

لكن Edge0 تغير قواعد اللعبة من خلال محرك استنتاج موحد يُعرف باسم ‘prerouter’، الذي يقوم بتنبؤ توجيه الطبقة التالية مسبقًا، وهي خطوة تتيح معالجة المعلومات بشكل أسرع وأكثر كفاءة. يقوم هذا النظام المتطور بالتنبؤ بواحدة من عُملاته قبل أن يتم استهلاك النتائج، مما يضمن عدم فقدان أي بيانات.

على جهاز متوسط بسعة 24 جيجابايت، يمكن لـ Edge0 إدارة 35 billion MoE بسرعة تصل إلى 20 توكن في الثانية (tok/s)، مع الحفاظ على مليغابايت واحدة من الذاكرة النشطة، مما يظهر فعالية لا تصدق لهذه التقنية في استغلال الذاكرة مقارنة بالنماذج التقليدية. بل وتحافظ على دقة أداء قريبة من نماذج fp16 الأكثر تطوراً في خمسة معايير عامة.

هذه التقنية ليست فقط للاستخدام الفردي، بل تم فتح إطار العمل بالكامل ككود مفتوح، مما يعني أن المطورين يستطيعون الاستفاده من نقاط قوته وتفاصيله. وهذا يفتح آفاقًا جديدة للأبحاث المستقبلية ويُعزز من إمكانية استخدام الذكاء الاصطناعي بصورة أكثر كفاءة واستدامة.