في عالم الذكاء الاصطناعي، تعتبر تقنيات التعلم التعزيزي (Reinforcement Learning – RL) من الأدوات المركزية التي تُستخدم لتحسين قدرات التفكير لدى نماذج اللغة الكبيرة (Large Language Models). ولكن، غالبًا ما تفتقر طرق تقييم المهام الحالية إلى العمق، حيث تعتمد على إشارات فرعية مثل نسبة النجاح أو المكافأة الحالية، والتي لا تعكس بالضرورة الاختلافات في كيفية استجابة المهام لمزيد من التدريب.

في دراستنا الأخيرة، ندرس مفهوم "تعلم المهام"، الذي يمثل مقياسًا يُشير إلى الاستجابة الإيجابية المتوقعة للتدريب المستمر ضمن إطار عمل ثابت للتعلم التعزيزي. من خلال تحليل مسارات المكافآت لكل مهمة، تبين لنا أن قابلية التعلم يمكن تكرارها عبر سياقات تدريب تم اختيارها بشكل مستقل، كما أنها تُعد مؤشرا دقيقا لفائدة النموذج في المهام اللاحقة.

لتسهيل استخدام هذه الفكرة قبل بدء التدريب، نقدم تقنية "TrajVal"، وهي مقدّر خفيف الوزن يقوم بتقريب قابلية التعلم لكل مهمة انطلاقًا من عملية تجريبية قصيرة وتقيمين نهائيين. وهذه التقنية ليست مفيدة فقط كتوجه مستقل لتحديد مهام التدريب، بل يمكن أيضًا استخدامها كمُعدِّل لأدوات الجدولة المتاحة.

أظهرت التجارب على معايير التفكير الرياضي والمنطقي عبر مقاييس متعددة من النماذج أن استخدام TrajVal يعزز كفاءة البيانات بشكل ملحوظ مقارنة مع طرق التوزيع المتساوي، ويؤدي إلى تحسينات إضافية عند الدمج مع أساليب الجدولة الإلكترونية. إن إدخال هذا القياس الجديد يقدم فرصًا مثيرة لتطوير نماذج أكثر كفاءة في استجابة المهام مما يفتح آفاق جديدة في مجالات الذكاء الاصطناعي والتعلم الآلي.