في عالم الذكاء الاصطناعي، يشهد مجال نماذج اللغات المزيد من الابتكارات المثيرة. من بين هذه الابتكارات، يبرز نموذج TinyCeNN-LM، الذي يقدم حلاً مبتكرًا لمشكلة التوافق عند استبدال الانتباه (Attention) في نماذج اللغة المُدرّبة مسبقًا. تتضمن هذه النقلة النوعية استخدام إطار تحويل جديد يعتمد على "الطبقات الدائرية المستوحاة من CeNN"، والتي توفر معالجة محلية محدودة لذاكرة متكررة، مما يتيح إجراء تحويلات عالية الجودة.
تقوم الفكرة الأساسية للنموذج على القدرة على تغيير طبقات معينة من النموذج بناءً على معايير محددة، مما يسهم في تحسين الأداء العام للنموذج. تم دراسة ثلاثة تنفيذات مختلفة لهذا الإطار، وهي: الذاكرة المتكاملة (Integrated Memory)، وMemoryFusion، وPDelta3-GDN2-CLVR+Local32.
تشير النتائج إلى أن التحويل الصارم باستخدام PDelta3 يقبل الطبقات فقط عند توافقها مع معايير محددة لضمان الكفاءة. على سبيل المثال، في تجربة SmolLM2-135M، تم قبول الطبقات من 0 إلى 2 بفضل نسبة تعادل منخفضة بلغت +0.01209، في حين تم رفض الطبقة 3 رغم ملاءمتها لمعايير NLL بسبب فشل دقة التمثيل.
وعند تطبيقه على نموذج Qwen3.5-0.8B، تم قبول الطبقات الكاملة في 3 و7 و11 مع تحسين مقاييس NLL لتعزيز القدرة على معالجة النصوص. من المثير للإعجاب أن نموذج الذاكرة المتكاملة حافظ على نسبة التشتت ضمن +0.93%، بينما تم تقليل استهلاك الذاكرة بمعدل يصل إلى 6.01%.
توجّه هذه النتائج الباحثين نحو تبني التحويل البنيوي المكثف بعناية بدلاً من الاعتماد على استبدال شامل لتقنية الانتباه، مما يسلط الضوء على أهمية الجودة في التطبيقات العملية لنماذج اللغة المستقبلية.
ثورة جديدة في نماذج اللغات: TinyCeNN-LM تقدم تحويلًا مبتكرًا مع طبقات دائرية مستوحاة من CeNN!
تقدم TinyCeNN-LM إطار تحويل جديد بعد التدريب، يعتمد على طبقات دورانية مستوحاة من CeNN، مما يحل مشكلة التوافق حيال استبدال الانتباه في نماذج اللغات. نتائج التجارب تظهر معدلات دقة مذهلة وانخفاض ملحوظ في استهلاك الذاكرة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
