في عالم الذكاء الاصطناعي، يعد تحسين نماذج التعلم من أبرز الاستراتيجيات لزيادة الدقة والكفاءة. من هنا، جاءت تقنية CoRT (Counterfactual Replay)، التي تهدف إلى تعزيز تجربة تعلم النماذج اللغوية عبر استخدام تقييمات قائمة على معايير محددة. لكن كيف تعمل هذه التقنية؟

تقوم تقنيات التعلم المعزز التقليدية، وخاصة تلك المبنية على GRPO (Gradient Reinforcement Policy Optimization)، بتقليل التقييمات الهيكلية إلى استجابة موحدة تُعاقب أو تكافأ جميع الرموز المدخلة بالتساوي. وهذا يعني أنه لا يوجد آلية واضحة لتوزيع الائتمان أو التقييم على مستوى الرموز المختلفة داخل الاستجابة الواحدة.

تدخل تقنية CoRT لتقدم حلاً مبتكراً، حيث تعتمد على إعادة اللعب المحتمل لإعادة تقييم نفس الاستجابة المُختارة باستخدام معايير التقييم الأصلية ومعايرة بدون معايير. تستخدم CoRT الفارق في احتمالية الرموز كدليل لمدى اعتماد كل رمز على السياق التقييمي، مما يسمح بتوزيع الائتمان بشكل أكثر دقة على الرموز المختلفة.

أظهرت التجارب المعتمدة على نماذج معدلة وفق تعليمات محددة أن CoRT تتفوق على الطرق التقليدية بنسبة 4.4 نقطة مئوية في الغالب. وعلى الرغم من تعقيد آليات التعلم المعزز، تبقى النتائج تنافسية مع أساليب أخرى تقدم توزيعاً للائتمان على مستوى الرموز، مما يسهل عملية التعلم ويؤكد استقرار النموذج.

مع استعداد CoRT للعب دور محوري في تحسين كيفية تدريب نماذج الذكاء الاصطناعي، يمكننا أن نستشرف مستقبلاً أكثر اشراقاً في عالم التقنيات المتقدمة.