في عصر الذكاء الاصطناعي المتقدم، أصبحت النماذج اللغوية الكبيرة (Large Language Models) تعتمد بشكل متزايد على مهارات قابلة لإعادة الاستخدام لتوسيع قدراتها وتجاوز المعرفة المعلمية المعتادة. إلا أن التحدي الكبير يكمن في استرجاع المهارة المناسبة من مكتبة ضخمة، خاصة أن طلبات المستخدمين غالبًا ما تكون مختصرة وغير محددة، حيث تُحدد الأهداف فقط بينما تبقى القدرات اللازمة وخطوات التنفيذ غامضة.

للتغلب على هذا التحدي، تم تقديم SkillReason-Bench، وهو معيار كبير عبر المجالات يحتوي على 3,729 استعلامًا ومكتبة استرجاع تضم 61,228 مهارة تنتمي إلى تسعة مجالات. بالإضافة إلى ذلك، تم اقتراح SkillReason، وهو إطار عمل من مرحلتين يستخدم طريقة التفكير المنطقي (chain-of-thought reasoning) كإشراف تدريبي لاسترجاع المهارات.

في المرحلة الأولى، تُستخدم تتبع القدرات الناتجة عن معلم أقوى لتوفير إشراف واضح من خلال التعلم التبايني (contrastive learning) والتوافق بين توزيعات الاسترجاع ونمذجة اللغة، مما يشجع الباحث على استيعاب التفكير المنطقي في تمثيل الاستعلام. أما في المرحلة الثانية، فإن هدف GRPO الموجه بالاسترجاع يشجع النموذج على استكشاف مسارات التفكير التي تناسب قدراته بشكل أفضل وتكون أكثر فعالية في الاسترجاع.

عند تنفيذ الاستعلام، يقوم SkillReason بترميز الاستعلام الأصلي مباشرة دون الحاجة لتوليد ملاحظاتautoregressive، مما يحافظ على كفاءة استرجاع الاستعلامات فقط. أظهرت التجارب المكثفة على SkillReason-Bench وSkillRet وSRA-Bench أن SkillReason حقق أداءً رائدًا عبر كل المعايير الثلاثة، مما يثبت أن التدريب المعزز بالتفكير المنطقي يمكن أن يbridges الفجوة السيمانتية بين الأهداف العليا للمهام وقدرات المهارات.