تزايد استخدام البيانات الاصطناعية (Synthetic Data) في تدريب نماذج اللغات الكبيرة (Large Language Models) كوسيلة لتعزيز أداء هذه النماذج. ومع ذلك، ليس كل ما هو اصطناعي يساعد في تحسين النماذج، إذ أن القيمة الحقيقية للبيانات تكمن في قدرتها على تقديم معلومات جديدة وملائمة دون إدخال أخطاء تؤثر سلباً.

لطالما خاصة، يتغير تأثير الأمثلة كما يتطور مجموعة التدريب، وهو ما جعل الباحثين يسعون لتطوير نظرية جديدة. في هذا الإطار، تم تقديم أسلوب مبتكر يحمل اسم "Training-Aware Target Coverage" (TATC) والذي يستهدف اختيار بيانات اصطناعية تستطيع تحسين نتائج التدريبات. يقوم هذا الأسلوب بتحديد البيانات المرشحة التي تفيد في تحقيق الأهداف المستهدفة، والعمل على توسيع نطاق هذه البيانات بطرق لم تكن ممثلة سابقاً.

تجارب أجريت على بيانات النصوص والصور أظهرت فعالية هذا الأسلوب، خصوصاً عند التعامل مع مهام المنطق الرياضي. حيث استطاع TATC اختيار الحلول الاصطناعية بشكل فعال لتحسين أداء النموذج Qwen2.5-Math-1.5B-Instruct، متفوقاً على طرق اختيار البيانات الاصطناعية الأخرى المستخدمة في اختبارات مثل GSM8K.

باختصار، يقدم هذا البحث نهجاً منهجياً لانتقاء البيانات الاصطناعية عبر قياس وتعظيم قيمتها بالنسبة للمهام المستهدفة، مما يعد خطوة مهمة نحو تحسين نماذج الذكاء الاصطناعي.