في عالم تتسارع فيه وتيرة الابتكار في الذكاء الاصطناعي، تمثل طريقة التدريب الجديدة، المعروفة باسم التدريب الحاسم الوكالي (Agentic Critical Training - ACT)، نقلة نوعية في كيفية تعليم نماذج اللغة.

تُعتبر أساليب التعلم التقليدية التي تعتمد على تقنيات التعلم بالتقليد (Imitation Learning - IL) فعالة في تعليم الوكلاء الذكيين إعادة إنتاج أفعال الخبراء، لكنها تفتقر إلى قدرة النموذج على التمييز بين الأفعال الصحيحة والأخطاء المحتملة.

تقدم ACT حلاً مبتكرًا عبر استخدام التعلم المعزز مع المكافآت القابلة للتحقق (Reinforcement Learning with Verifiable Rewards - RLVR)، حيث يتم تدريب النماذج على تقييم الأفعال بشكل مباشر. في كل حالة من حالات مسار الخبراء، يتم جمع فعل خبير مع خيار بديل، مما يعزز من قدرة النموذج على اتخاذ القرارات الصحيحة.

النتائج كانت مثيرة، حيث أظهرت التجارب على نماذج مثل Qwen3-8B وOlmo-3-7B-Instruct تحسنًا بمتوسط 5.85 نقطة مقارنة بأساليب IL التقليدية.

مثل هذه الابتكارات ليست فقط مثيرة للإعجاب، بل تمهد الطريق لتحسينات مستقبلية في أداء الذكاء الاصطناعي، مما يفتح المجال أمام استخدامات جديدة تجد في الذكاء الاصطناعي رفيقًا قويًا في مختلف المجالات.