في عالم الذكاء الاصطناعي، يعتبر اختيار بيانات التدريب المناسب أمراً حيوياً من أجل تحسين الأداء العام للنماذج. وقد قامت الأبحاث الجديدة بتسليط الضوء على مشكلة تعاني منها النماذج اللغوية الكبيرة (Large Language Models) تتعلق بانحياز البيانات المختارة لتدريب تلك النماذج. تتناول هذه الدراسة كيفية معالجة هذه المشكلة عبر تقديم خوارزمية جديدة تُعرف باسم BIDS (Balanced and Influential Data Selection).

تستند هذه الخوارزمية إلى منهجية قائمة على التأثير، حيث تقيم مساهمة كل مثال تدريبي في توقعات النموذج. ورغم أن الأساليب القائمة على التأثير تُظهر نتائج واعدة في تحسين القدرات، إلا أنها غالباً ما تواجه صعوبة في تحقيق أداء متوازن عبر المهام المختلفة. تكشف الدراسة أن الأداء غير المتوازن ينجم عن انحياز داخلي في بعض المهام التي تؤثر بشكل أكبر على الأداء الكلي للنموذج.

تحلل خوارزمية BIDS بيانات التدريب عن طريق تطبيع درجات التأثير، وبعد ذلك تقوم باختيار المثال الأكثر تأثيراً على المهمة الأقل تمثيلاً. وقد أظهرت التجارب التي أجريت على نموذجين، Llama-3 وMistral-v0.3، نتائج مبهرة، حيث أثبتت أن BIDS تتفوق بشكل مستمر على الأساليب التقليدية وأطر العمل الأخرى. بل والمثير أن التدريب على مجموعة بيانات تتكون من 15% فقط، تم اختيارها باستخدام BIDS، أظهر أداءً أفضل مقارنة بالتدريب على مجموعة بيانات كاملة.

تتضمن هذه النتائج نظرة جديدة في كيفية تحسين التعلم المتوازن بين مهام متعددة، مما يفتح الطريق لتقنيات جديدة في تطوير نماذج الذكاء الاصطناعي. يجسد هذا البحث نقطة تحول في التعامل مع بيانات التدريب، ويشير إلى أهمية كل من تطبيع مثيلات البيانات وتحسين الاختيار للقدرات المتنوعة.