في عملية تطور الذكاء الاصطناعي، يُعد نموذج A.X K2 خطوة مذهلة يُضاف إلى قائمة النماذج اللغوية المتطورة. يُعتبر هذا النموذج، الذي يحتوي على 688 مليار معلمة، نموذجًا معتمدًا على مزيج من الخبراء (Mixture-of-Experts) تمت تدريبه من الصفر، مما يجعله خيارًا مثيرًا لتطبيقات أكثر تطورًا.

مع إعداده باستخدام حوالي 8.5 تيرابايت من الرموز، وهو عدد أقل مقارنةً بسلفه A.X K1، يعتمد النموذج على مزيج أصغر لكنه ذو جودة أعلى ببيانات غنية حول التطبيقات الذكية والهندسة البرمجية. ومن المثير للاهتمام أن A.X K2 يُظهر تحسنًا ملحوظًا مقارنةً بـ A.X K1، بتحقيق تحسينات تتجاوز 30 نقطة مئوية في بعض المعايير، مما يدل على كفاءة كبيرة في معالجة الرموز.

لتعزيز القدرة على معالجة السياقات الطويلة بكفاءة، تم إدخال تقنية Sparse Gated Attention (SGA) التي تجمع بين الانتباه المتناثر والانتباه المحكم، كما تم اعتماد Gated Norm (GN) لاستقرار عمليات التدريب على نطاق واسع. يعد SGA مبتكرًا حيث يتم تدريبه بشكل أصلي على 128K من خلال مؤشر متناثر يعمل على تحسين الأداء بشكل فعال.

تظهر التقييمات الشاملة أن A.X K2 يتنافس بقوة مع النماذج المفتوحة الوزن، حيث يحقق أداءً متساويًا أو يتجاوزها في اختبارات الرياضيات واللغة الكورية، مما يجعله نموذجًا لابد من تقديره في ساحة الذكاء الاصطناعي. شهدنا ابتكارات ملحوظة توضح كيف أن القدرة على الانتقال بين أوضاع التفكير وغير التفكير داخل نموذج موحد تعتبر وصفة فعالة جدًا.

ماذا برأيكم عن هذا التطور المذهل؟ شاركونا آراءكم في التعليقات!