في وقت تتطور فيه الأنظمة الوكيلة من أنظمة أدوات فردية إلى هياكل مركبية متعددة، تبرز أهمية المهارات كأداة فعّالة لتطوير القدرات وتوزيعها. لكن، واجه المجتمع الأكاديمي نقصًا في الإطار المنهجي المناسب لتحليل وتقييم المهارات بشكل متسق.

وبذلك، تم اقتراح إطار MCRI (Four-Dimensional MCRI Framework) الذي يستند إلى قواعد معلوماتية وقيود سلوكية. يتمثل هذا الإطار في تطبيق MCRI-Eval، وهو طريقة تقييم تعتمد على نموذج لغوي كبير (Large Language Model).

قمنا بتقييم MCRI-Eval باستخدام 63,812 مهارة عامة من OpenClaw Skill Hub، مع تنفيذ نماذج مشروطة بالمهارة تمثل 58,275 حالة عبر BigCodeBench، BFCL-Fundamental، وMind2Web. وقد أظهرت درجات MCRI-Eval ارتباطًا إيجابيًا مع إشارات شعبية المجتمع، محققة أعلى اتفاقية في التقييم بين الطرق المدروسة.

بالإضافة إلى ذلك، يحسن MCRI-Eval من اختيار المهارات العلوية الأول عبر جميع المعايير الثلاثة، حيث تقدم المهارات المختارة فرقًا ملحوظًا في الأداء تصل إلى 22.8 بالمئة في BigCodeBench، و19.6 بالمئة في Mind2Web. هذه النتائج تدل على أن MCRI-Eval يوفر إشارة مفيدة قبل التقييم القائم على التنفيذ، مما يتيح الأولوية للمهارات الواعدة قبل إجراء التقييم المكلف.