في عالم تتسارع فيه وتيرة الابتكار في الذكاء الاصطناعي، تمثل طريقة التدريب الجديدة، المعروفة باسم التدريب الحاسم الوكالي (Agentic Critical Training - ACT)، نقلة نوعية في كيفية تعليم نماذج اللغة.
تُعتبر أساليب التعلم التقليدية التي تعتمد على تقنيات التعلم بالتقليد (Imitation Learning - IL) فعالة في تعليم الوكلاء الذكيين إعادة إنتاج أفعال الخبراء، لكنها تفتقر إلى قدرة النموذج على التمييز بين الأفعال الصحيحة والأخطاء المحتملة.
تقدم ACT حلاً مبتكرًا عبر استخدام التعلم المعزز مع المكافآت القابلة للتحقق (Reinforcement Learning with Verifiable Rewards - RLVR)، حيث يتم تدريب النماذج على تقييم الأفعال بشكل مباشر. في كل حالة من حالات مسار الخبراء، يتم جمع فعل خبير مع خيار بديل، مما يعزز من قدرة النموذج على اتخاذ القرارات الصحيحة.
النتائج كانت مثيرة، حيث أظهرت التجارب على نماذج مثل Qwen3-8B وOlmo-3-7B-Instruct تحسنًا بمتوسط 5.85 نقطة مقارنة بأساليب IL التقليدية.
مثل هذه الابتكارات ليست فقط مثيرة للإعجاب، بل تمهد الطريق لتحسينات مستقبلية في أداء الذكاء الاصطناعي، مما يفتح المجال أمام استخدامات جديدة تجد في الذكاء الاصطناعي رفيقًا قويًا في مختلف المجالات.
إطلاق طريقة جديدة لتدريب الوكلاء الذكيين: التدريب الحاسم الوكالي
طرحت دراسة حديثة طريقة جديدة تُعرف باسم التدريب الحاسم الوكالي (Agentic Critical Training) التي تعزز من قدرة نماذج اللغة على تقييم الأفعال بشكل مباشر. تقدم هذه الطريقة تحسينات ملحوظة في أداء الوكلاء الذكيين مقارنة بالأساليب التقليدية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
