في عالم الذكاء الاصطناعي، تُعتبر النماذج الصغيرة (Small Models) أدوات حيوية تلعب دورًا كبيرًا في تحسين التدريب للنماذج الكبيرة (Large Models). في دراسة جديدة تم نشرها في arXiv، تم تقديم مفهوم مثير للاهتمام حول كيفية استخدام هذه النماذج الصغيرة لتحديد مزيج البيانات اللازم لأغراض التدريب واسع النطاق.
تسعى الدراسة للبحث في إمكانية أن تكشف مسارات تدريب النماذج الصغيرة عن هيكل يمكن نقله، يتعلق بطريقة resolução الفعالة للعقبات التي تواجه أداء النماذج الكبيرة. تمت صياغة نموذج جديد يحمل اسم "LogFloor"، والذي يعمل كنظام تحكم مغلق يوجه كل جولة تدريبية نحو العقبات الحالية، مما يؤدي إلى مسارات دالة مرتبة.
عند تطبيق تقنية LogFloor على خمسة عينات من مهارات bAbI باستخدام نموذج Qwen2.5-1.5B، أظهرت النتائج تحقيق انخفاض بنسبة 56.2% في تكاليف الرموز المطلوبة. وفي نقل البيانات من نموذج بحجم 70 مليون إلى 12 مليار، تمكنت تقنية LogFloor من توفير 30.9% من الموارد عبر الجولات المتكررة، مما يعكس كفاءة عالية في استهلاك الوقت والموارد.
كما أظهرت التجارب على قياس MMLU-control أن المسار المجمد للنموذج قد نجح عبر جميع السيناريوهات المستهدفة. وقد أوضحت النتائج أن إسقاط المسار إلى مزيجه الثابت أو عكس ترتيب مراحله يقلل بشكل كبير من فوائد العلاج الذكي، ولكن الاحتفاظ بعلامات العقبات لا يزال مفيدًا جزئيًا.
تُظهر هذه النتائج أن تحديد العقبات بشكل مرتب يقدم هيكلًا تعليميًا قابلاً للنقل لتدريب مهارات محددة بشكل ممنهج، وهو ما يفتح مجالات جديدة للبحث في مجال الذكاء الاصطناعي والتحسين الوظيفي للنماذج الأكثر تعقيدًا.
الكشف عن أسرار التدريب الذكي: كيف تساهم النماذج الصغيرة في تحسين أداء النماذج الكبيرة؟
تسهم النماذج الصغيرة في تحديد أولويات التدريب للنماذج الكبيرة من خلال طريقة جديدة ومبتكرة. هذا البحث يسلط الضوء على كيفية تحسين الكفاءة وتقليل التكلفة في معالجة البيانات.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
