تزايد استخدام البيانات الاصطناعية (Synthetic Data) في تدريب نماذج اللغات الكبيرة (Large Language Models) كوسيلة لتعزيز أداء هذه النماذج. ومع ذلك، ليس كل ما هو اصطناعي يساعد في تحسين النماذج، إذ أن القيمة الحقيقية للبيانات تكمن في قدرتها على تقديم معلومات جديدة وملائمة دون إدخال أخطاء تؤثر سلباً.
لطالما خاصة، يتغير تأثير الأمثلة كما يتطور مجموعة التدريب، وهو ما جعل الباحثين يسعون لتطوير نظرية جديدة. في هذا الإطار، تم تقديم أسلوب مبتكر يحمل اسم "Training-Aware Target Coverage" (TATC) والذي يستهدف اختيار بيانات اصطناعية تستطيع تحسين نتائج التدريبات. يقوم هذا الأسلوب بتحديد البيانات المرشحة التي تفيد في تحقيق الأهداف المستهدفة، والعمل على توسيع نطاق هذه البيانات بطرق لم تكن ممثلة سابقاً.
تجارب أجريت على بيانات النصوص والصور أظهرت فعالية هذا الأسلوب، خصوصاً عند التعامل مع مهام المنطق الرياضي. حيث استطاع TATC اختيار الحلول الاصطناعية بشكل فعال لتحسين أداء النموذج Qwen2.5-Math-1.5B-Instruct، متفوقاً على طرق اختيار البيانات الاصطناعية الأخرى المستخدمة في اختبارات مثل GSM8K.
باختصار، يقدم هذا البحث نهجاً منهجياً لانتقاء البيانات الاصطناعية عبر قياس وتعظيم قيمتها بالنسبة للمهام المستهدفة، مما يعد خطوة مهمة نحو تحسين نماذج الذكاء الاصطناعي.
كيف يمكن للبيانات الاصطناعية تحسين نماذج الذكاء الاصطناعي؟ اكتشفوا الطريقة الرائدة!
تقدم دراسة جديدة أسلوباً مبتكراً لاختيار البيانات الاصطناعية لتحسين أداء نماذج الذكاء الاصطناعي. يركز هذا الأسلوب على تعظيم القيمة المضافة للتعلم من البيانات بدلاً من مجرد زيادة الكمية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
