في عالم الذكاء الاصطناعي، تعتبر نماذج اللغة الصغيرة (Small Language Models - SLMs) ذات المعلمات التي تتراوح بين 70 إلى 500 مليون معلمة محط اهتمام كبير. ومع ذلك، يعتقد الكثيرون أن مواءمتها باستخدام التعلم المعزز (Reinforcement Learning) غير مستقرة، تاركةً العديد من الأسئلة حول الآليات الكامنة وراء هذه الإخفاقات غير المحققة.
التحديات التي تواجه هذه النماذج كانت موضوع دراسة جديدة حيث تم تدريب خمسة عشر تكويناً (model, corpus) باستخدام خوارزمية تحسين السياسات القريبة (Proximal Policy Optimization - PPO). تم تنفيذ التجارب على نماذج مثل Pythia-70M و160M و410M وكذلك SmolLM2-135M و360M على ثلاثة مجموعات بيانات: TinyStories وCNN/DailyMail وWikitext-103.
توصل الباحثون إلى ثلاث أنماط فشل قابلة للتكرار تحدث في نماذج اللغة الصغيرة: 1. تجميد معلمات LoRA بشكل صامت في خطوط أنابيب PEFT/TRL القياسية. 2. تجاوز عددي في نسب الأهمية عند استخدام bfloat16. 3. انهيار كارثي في السياسات بسبب خطأ نموذج المكافآت.
تم معالجة هذه القضايا باستخدام تقنية الدمج وإعادة التهيئة، واستخدام دقة float32 أثناء تحديثات PPO، وتطبيق آلية أمان ثلاثية الطبقات تتضمن تبييض المكافآت، والحماية من نسب الأهمية، والعودة للوزن.
بالإضافة إلى ذلك، تقدم الورقة فرضية تفيد بأن أداء PPO على نطاق SLM يعتمد على نموذج مشرف سائل (PPL < 20) وإشارة مكافأة تمييزية، بدلاً من عدد المعلمات.
أدت هذه التطورات إلى استقرار النظام أثناء التجارب، مما ساهم في تحسين معدل الفوز في التفضيلات مقارنةً بالخط الأساسي SFT في التكوينات مع إشارات مكافأة معلوماتية. بل وأكثر من ذلك، لقد تخطى الأداء تلك النماذج المعتمدة على التعليم، مع تقليل كبير في كمية بيانات التدريب المطلوبة.
جميع النماذج والتحقق من صحة البيانات وبيانات التدريب تم إصدارها للعامة، مما يفتح المجال لمزيد من التجارب والاكتشافات في هذا المجال المثير.
خطوة جديدة نحو تعزيز التعلم المعزز لنماذج اللغة الصغيرة!
في دراسة جديدة، تم استكشاف التحديات التي تواجه نماذج اللغة الصغيرة، حيث تم تحديد ثلاثة أنماط فشل يمكن أن تعرقل الأداء. باستخدام تقنيات مبتكرة، تم تحقيق تحسين كبير في استقرار الأداء.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
