في عالم الذكاء الاصطناعي، يعد تحسين الكفاءة أمرًا حيويًا للتقدم في التطبيقات المختلفة. ومن بين الأساليب المتبعة، تأتي عملية التقطير (Distillation) لتجميع المعرفة من نموذج فعّال وتحويله إلى نموذج هجين أكثر كفاءة. يقدم البحث الأخير بعض الرؤى المثيرة حول كيفية تصغير نماذج الترانسفورمر (Transformer) وتقليل تكاليف الاستدلال دون تضحية كبيرة في جودة الناتج.
على الرغم من أن عملية التقطير تُظهر نتائج واعدة على صعيد تقليل التكاليف، إلا أن ضمان جودة التوليد في النماذج المقطرة يتطلب تصميمًا دقيقًا لكل من الهيكل المعماري للنموذج وعمليات التقطير. فقد أظهرت الدراسات السابقة أن تقييم جودة النماذج بشكل يعتمد على دقة الاحتمالية (Log-likelihood) قد يغفل فروقات هامة في الجودة، وهو ما أثبتته نتائج التجارب على معايير متعددة.
على سبيل المثال، كشفت الأبحاث الأخيرة أن نموذجًا مقطرًا يضم 7 مليارات معلمة، رغم أنه يتقارب مع نتائج النموذج الأب (Teacher) بنسبة 0.2 pp تحت نظام التقييم، إلا أنه يتراجع بفارق 20.8 pp عند الحاجة لإنتاج الأجوبة بشكل تتابعي. لمزيد من التحقيق في هذه الظاهرة، تم وضع مشروع GenDistill كخط أنابيب متعدد المراحل لتحويل النموذج المدرب مسبقًا إلى نموذج هجين يستخدم انتباه كيمي دلتا (Hybrid Kimi Delta Attention).
عبر تصميم دراسات دقيقة، استعرضنا ستة محاور تصميم مختلفة: الهدف التدريبي، تنقيح الخسارة، مدة التدريب، اختيار مجموعة البيانات، تجميد المعلمات، وخيارات الهيكل، وتم تقييم كل خيار باستخدام بروتوكولات التقييم المبنية على الاحتمالية والتوليد.
وجدنا أن تقييم دقة الاحتمالية يميل إلى التقليل من الفجوة بين النموذج الأب والنموذج المقطر، وفي بعض الحالات، يمكن أن يغير تصنيف خيارات التصميم.
تشير النتائج إلى أن اختيار مجموعة البيانات، والتنقيح القائم على الإكمال، وتجميد طبقات الانتباه خلال فترة ما بعد التدريب لها أكبر تأثير على جودة التوليد. ووفقًا لوصفة التقطير المثلى لدينا، يحتفظ نموذج هجيني كطالب بدقة تتراوح بين 86-90٪ من دقة النموذج الأب في معايير المعرفة، ويقلل من ذاكرة KV cache بنسبة تصل إلى 75٪ بينما يحسن الوقت حتى الحصول على الرمز الأول بحدود 2-4 مرات عند سياقات ضخمة تصل إلى 128 كيلوبايت.
ختامًا، تبرز هذه النتائج أهمية التقييم الدقيق في فهم جودة وأساليب النماذج المقطرة، مما يغير من أسلوبنا في الابتكار ضمن عالم الذكاء الاصطناعي.
تحويل نماذج التعلم العميق: كيف يمكن للدقة المذهلة أن تؤثر على جودة التوليد!
تتحدث هذه المقالة عن كيفية تحسين النماذج الهجينة من خلال عملية التقطير لتقليل تكاليف الاستدلال، مع التركيز على جودة التوليد. الاكتشافات الجديدة تظهر الفجوة الواضحة بين تقييمات دقة النموذج وجودة توليد النتائج.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
