في عالم الذكاء الاصطناعي، تنمو التطورات بوتيرة سريعة، ومن بين هذه التطورات يظهر نموذج Gated DeltaNet (GDN) كأحد النماذج الرائدة. هذا النموذج الهجين، الذي يجمع بين التقنيات التقليدية الحديثة، أثبت كفاءته في التعامل مع تحديات التكميم 4-بت (4-bit quantization) التي كانت تُعتبر عائقًا أمام تحقيق الأداء العالي.
تعمل النماذج الهجينة على دمج آليات الانتباه الناعم مع طبقات الانتباه الخطي، مما يسمح للنموذج بتلخيص السياق بحجم ثابت. في دراسة حديثة، تم تقييم نماذج مثل Qwen3.8-27B، والتي تحتوي على 48 طبقة GDN و16 طبقة انتباه، حيث تمكنا من اختبار الحدس بأن الأخطاء في التكرار تتراكم في السياقات الطويلة.
من خلال بناء النموذج الجديد Minima، الذي يستخدم تقنية NVFP4 وW4A4، وُجد أن هذا النموذج يتفوق حقًا على التحديات السابقة. على جميع الأسنان في اختبارات شتى، بما في ذلك تحديات MMLU-Pro وGSM8K، أثبت Minima أنه يمكن تحقيق نتائج متقاربة مع الدقة العالية (BF16)، بينما يظل في نفس الوقت النموذج الأصغر والأسرع من تلك التي تمت مقارنتها.
قامت الدراسة أيضًا بتسليط الضوء على آلية عمل NVFP4 وكيف تم تحسين أداء النموذج بطرق فعالة: فقد أدت تحسينات مثل وضع فرط تنظيم للاكتشاف المحلي للأخطاء، وتجاوز انخفاض الحساسية في تكوينات البوابات، إلى تقليل كبير في أخطاء الإخراج.
تتطلب أمور التكميم الجديدة أساليب متطورة، وقد أدت هذه الإصدارات إلى نجاحات ملموسة في الذكاء الاصطناعي، مما يدل على قدرة هذه النماذج على التكيف والابتكار على الرغم من القيود التقنية.
إذا كنت مهتمًا بالتطورات الجديدة في هذا المجال، فلا تتردد في طرح آرائك وأفكارك في التعليقات أدناه!
تكنولوجيا مُبهرة: لماذا صمد نموذج Gated DeltaNet أمام تقنيات التكميم 4-بت؟
تقدم دراسة جديدة تقنيات مبتكرة تحقق أداءً مُتقدمًا في نماذج التعلم العميق باستخدام تكميم 4-بت. نقدم لكم نتائج مشوقة حول نموذج Gated DeltaNet وكيفية استمراره في التفوق على التحديات التقنية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
