في عالم الذكاء الاصطناعي، يواجه الباحثون تحديات جمة في تدريب النماذج اللغوية الصغيرة (Small Language Models - SLMs)، خاصة فيما يتعلق بتكلفتها وفعاليتها. مما لا شك فيه أن هذه النماذج تُعد من الأدوات الحيوية التي تحتاجها التطبيقات الحديثة. ولكن كيف يمكننا تحسين أدائها دون تحميل النظام بأعباء إضافية؟
تُظهر الأبحاث الجديدة التي تم نشرها على منصة arXiv من خلال ورقة بعنوان "A Token is Worth over 1,000 Tokens" كيف يمكن التغلب على التحديات التي تواجه النماذج اللغوية. حيث يركز الباحثون على ثلاثة مشكلات رئيسية: فقدان المعلومات الناتج عن التقليم القاسي، عدم كفاءة محاذاة التوكينات، واستخدام التفعيلات المفيدة بشكل غير كافٍ، وخصوصًا من الشبكات التقدمة (Feed-Forward Networks - FFNs).
لحل هذه القضايا، تم تطوير تقنية تُعرف باسم Low-Rank Clone (LRC)، وهي طريقة تدريب مسبق فعالة تهدف إلى إنشاء نماذج SLMs تسعى لأن تكون متطابقة سلوكيًا مع نماذج التدريس القوية. تقوم LRC بتدريب مجموعة من مصفوفات الإسقاط منخفضة الرتبة التي تمكّن من التقليم الناعم من خلال ضغط أوزان المعلم، ومحاكاة التفعيلات الخاصة بالطالب لتتطابق مع تلك الخاصة بالمعلم.
تستند نتائج تجارب واسعة النطاق على نماذج مفتوحة المصدر، مثل Llama-3.2-3B-Instruct وQwen2.5-3B/7B-Instruct، إلى إمكانية تحقيق LRC لأداء مماثل أو تفوق على نماذج أخرى تم تدريبها باستخدام تريليونات من التوكينات، وذلك مع استخدام 20 مليار توكين فقط، مما يُظهر كفاءة تدريب تتجاوز الألف مرة.
يُعتبر هذا الابتكار خطوة بارزة في مجال تدريب نماذج اللغة، ويفتح آفاق جديدة للباحثين والمطورين لتحسين كفاءة نماذجهم الخاصة دون الحاجة إلى موارد ضخمة. للمزيد من التفاصيل، يمكنكم زيارة Github أو Hugging Face.
ما رأيكم في هذا التطور الثوري في التدريب؟ شاركونا آراءكم في التعليقات!
ثورة في تدريب نماذج اللغة الصغيرة: كيفية تخفيض التكلفة بأكثر من 1000 مرة!
تمكن الباحثون من تطوير أسلوب مبتكر لتدريب نماذج اللغة الصغيرة باستخدام تقنية Low-Rank Clone، مما يزيد من كفاءة التدريب بشكل ملحوظ. النتائج تشير إلى تحقيق كفاءة تجاوزت 1000 مرة مقارنةً بالأساليب التقليدية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
