يعد تحدي تحديد رصيد القيم من التحديات المركزية في مجال التعلم المعزز (Reinforcement Learning - RL). حتى الآن، كانت الطريقة التقليدية التي يتبعها نموذج "الممثل-الناقد" (Actor-Critic) فعالة في تقدير المزايا من خلال دوال القيمة المتعلمة. ومع ذلك، تظهر المشكلة حينما يتم الابتعاد عن النماذج القيمية المتعلمة في تعلم الآلات ذات النماذج اللغوية الكبيرة (Large Language Models - LLM) بسبب صعوبة تدريب النقاد التقليديين بشكل موثوق.

تسعى الورقة الجديدة إلى إلقاء الضوء على مشكلة تعبير القبضة وتقديم حلول للتغلب عليها. تشير نظرية تعقيد التمثيل إلى أن وظائف القيمة قد تكون صعبة التقدير بحسب النموذج الأحادي المستخدم في النماذج الحالية. نتيجةً لذلك، تظهر التجارب أن النقاد لا يتحسنون على نحو موثوق عند زيادة حجم البيانات.

لذا، تم طرح نموذج "الناقد التوليدي" (Generative Actor-Critic - GenAC) الذي يستبدل طريقة التنبؤ بالقيمة الأحادية بنظام نقدي يُركز على التفكير المنهجي قبل إصدار التقديرات. كما يتم تقديم تقنية "التكيف داخل السياق" (In-Context Conditioning) التي تساعد الناقد على البقاء متوافقاً مع الممثل الحالي خلال التدريب.

نتائج هذا الابتكار تشير إلى تحسين كبير في تقدير القيم وموثوقية الترتيب، حتى أنه يحقق أداءً أفضل في مهام التعلم المعزز مقارنة بالنماذج التقليدية. بفضل هذه الابتكارات، يبدو أن نموذج GenAC قد يكون خطوة واعدة لتحسين عملية تحديد الائتمان في التعلم المعزز باستخدام النماذج اللغوية الكبيرة.