في عالم الذكاء الاصطناعي، يعد التدريب على نماذج اللغات الكبيرة (Large Language Models) من المهام الحيوية. ومع تعدد البيانات المستخدمة، تبرز الحاجة إلى اختيار مجموعات صغيرة (Minibatches) توازن بين سرعة التقارب وغطاء البيانات عبر مجالات متعددة. ولتلبية هذه الحاجة، تم تقديم طريقة جديدة تُعرف باسم PartitionSel.

تُعتبر PartitionSel نهجاً مبتكراً يركز على اختيار المجموعات بناءً على دلالات تقييمية موجهة بواسطة gradients، مع أخذه في الاعتبار الميزانيات المحددة لكل مجال ضمن قيود partition-matroid. ما يميز هذه الطريقة هو قدرتها على تقليل الازدواجية في الاختيارات عبر المجالات المختلفة، مما يؤدي إلى تحسين فعالية التدريب.

الدراسة تُبين أن الهدف من PartitionSel هو مُعقد ولكنه قابل للتطبيق، وقد تم اختبار هذه الطريقة عملياً خلال عملية تحسين Qwen2.5 وLlama-3 على مجموعات بيانات MetaMathQA وMol-Instructions. أظهرت النتائج أن PartitionSel حققت تحسينات ملحوظة مقارنة بالأساليب الأخرى التي تتعامل مع كل مجال بشكل مستقل، بالإضافة إلى تقليل عدد أزواج gradient المتضاربة داخل كل مجموعة.

إذا كنت مهتمًا بكيفية تشكيل هذه التطورات لأساليب التدريب الجديدة والتأثير المحتمل على تطبيقات الذكاء الاصطناعي، فإن هذا الابتكار يعد خطوة هامة في رحلة تطوير تقنيات الذكاء الاصطناعي.