شهد مجال الذكاء الاصطناعي قفزة نوعية جديدة مع اعتماد تقنية تحسين السياسات النسبية الجماعية (GRPO)، التي أثبتت كونها أسلوبًا فعالًا لتدريب النماذج اللغوية الصغيرة (Small Language Models) بذاكرة أقل، مما يجعلها مثالية للمهام المعقدة التي تتطلب تفكيرًا عميقًا.

لكن، تبقى ديناميكيات تدريب هذه التقنية على النماذج اللغوية الصغيرة غير مفهومة تمامًا، مما يحد من اعتمادها بشكل موثوق في البيئات المفتوحة والمحدودة الموارد. في هذا السياق، قمنا بإجراء دراسة شاملة لتدريب GRPO على نماذج تتراوح من 1.5 مليار إلى 7 مليار معلمة، باستخدام تجهيز الحوسبة القوي.

شملت دراستنا تنوعًا في عائلات النماذج ومجالات التفكير، بما في ذلك الرياضيات، البرمجة، والإجابة على الأسئلة متعددة الخيارات (MCQ) في العلوم. وقد تم تحليل كيف يؤثر حجم المجموعة على تقارب السياسة، استقرار التدريب، وأداء المعايير اللاحقة.

علاوة على ذلك، قمنا بتوصيف ديناميكيات تحديث التنسور أثناء تدريب GRPO، وتحققنا من تأثير اختيار وحدات ولوج العناصر المستهدفة (LoRA) والطبقات على تحسين أداء النماذج المعدلة بتقنية GRPO. في نتيجة هذه الدراسة، كانت النماذج المعدلة بتقنية GRPO تتفوق على نظيراتها الأساسية في حوالي 80% من تقييمات المعايير الرياضية، على الرغم من أنها أظهرت قدرة محدودة في مهام التفكير البرمجي وMCQ.

قمنا بتوجيه التحديثات بناءً على تقييماتنا الميكانيكية لتحسين إعدادات LoRA وتشكيل المكافآت. وكشفت النتائج أن هناك إمكانية فعالة لريادة تقنية GRPO لتدريب النماذج اللغوية الصغيرة في بيئات متنوعة. هذه النتائج تقدم إرشادات عملية لتحسين أداء التدريب القائم على النماذج اللغوية الصغيرة.