تشهد نماذج اللغات الكبيرة (Large Language Models) تقدمًا ملحوظًا في عمليات التفكير المعقدة، إلا أنَّ الأساليب الحالية في التفكير المتوازي غالبًا ما تعجز عن تمييز الإسهامات الفردية لكل مسار تفكير. هذا الأمر يؤدي إلى فقدان فعاليَّة التدريب، حيث يتم توزيع المكافآت بشكل موحد رغم أن بعض المسارات قد تكون زائدة أو مضللة.

في أحدث الدراسات، قدم الباحثون طريقة جديدة تُعرف باسم 'Parallel Shapley' التي تعتمد على التعلم المعزز (Reinforcement Learning) لتحسين الأداء التعليمي لنماذج الذكاء الاصطناعي. يعتمد هذا الإطار على مفهوم القيم الشابلية (Shapley Values) لتقدير المساهمات الهامشية لكل مسار تفكير، مما يؤدي إلى توزيع مكافآت دقيقة تناسب إسهامات كل جزء من التفكير.

تعتبر التجارب التي أُجريت على معايير التفكير الرياضي دليلاً على نجاح 'Parallel Shapley'، حيث أظهر الإطار الجديد أداءً أفضل من الأساليب التقليدية. ومن خلال استخدام نموذج مكافآت توليدي (Generative Reward Model) والاعتماد على تقنيات مونت كارلو للتقريب الفعال، استطاع النظام تحسين تنظيم التفكير المتعدد المسارات بشكل ملحوظ.

هذا الابتكار يُظهر كيف يمكن لتوزيع المكافآت أن يُساهم في صرف الأنظار عن 'الخاسرين المجانيين' الذين لا يُسهمون حقًا في النتائج، مما يرفع من فعالية التعلم واستقرار التدريب في نماذج الذكاء الاصطناعي.