في عالم الذكاء الاصطناعي، تُعتبر الخوارزميات التقليدية لتعلم اللغة (Language Model) محدودة عندما يتعلق الأمر بتوزيع المكافآت لكل رمز (Token) في المسارات الطويلة. غالبًا ما تعتمد تقنيات التعلم المعزز (Reinforcement Learning) على مكافأة نهائية لتحديد قيمة كل رمز، مما يحدّ من دقتها. لكن الآن، تقدم لنا خوارزمية Actor-Critic مع تقسيم الإجراءات (AC2) نهجًا مبتكرًا يغير هذا المفهوم.

تستفيد AC2 من فكرة توزيع المكافآت بشكل أكثر دقة عبر أقسام من الإجراءات بدلاً من التركيز على النهاية فقط. بدلاً من انتظار الوصول إلى مكافأة نهائية، تقوم هذه الخوارزمية بتقييم تأثير مجموعة من الإجراءات قصيرة المدة، مما يتيح تحديث السياسة (Policy) دون الحاجة إلى الانتظار حتى النهاية.

تم اختبار هذه الطريقة الجديدة على نموذج Qwen3-4B باستخدام مجموعة بيانات FineProofs-RL، وأظهرت أداء يتجاوز أفضل نتيجة سابقة بنسبة 18.5% مع استخدام 2.5 مرة أقل من FLOPs في عملية فك التشفير.

تعتمد AC2 على ثلاثة خيارات تصميمية رئيسية لتحسين كفاءتها:
1. **الاستعداد المحلي (Local Readiness)**: حيث تتم التحديثات بناءً على دقة المقيّم (Critic) في حل المشكلات.
2. **توفير حلول مرجعية**: تستخدم منهاجًا مرجعيًا من تجارب سابقة ناجحة لدعم المقيّم.
3. **تقييم عبر أقسام بحجم 10k رموز**: مما يمنح المقيّم جزءًا ذا مغزى من المسار لتقييمه.

مع هذا التقدم، تُظهر AC2 إمكانية كبيرة لتوسيع نطاق خوارزميات التعلم المعزز لنماذج اللغة، مما يفتح آفاق جديدة لم يتم استكشافها بعد. هل أنتم مستعدون لمشاهدة مستقبل الذكاء الاصطناعي يستمر في التطور؟ انضموا إلينا في مناقشة آرائكم حول هذا الاختراع الجديد.