في عالم الذكاء الاصطناعي، يمثل تدريب وكلاء قراءة الأدلة تحديًا كبيرًا، خاصة عندما يتعين عليهم العمل في مهام متعددة الأدوار. تقنية جديدة تم تقديمها مؤخرًا تحت اسم "تحسين سياسة مكافأة المعلومات السياقية" (CIGPO) تعد بمثابة الحل لهذه التحديات.

تعتمد CIGPO على استخدام استراتيجية حقن التباين، حيث يتم إعطاء مكافآت لكل دور من أدوار قراءة الأدلة، مما يساعد في منع انهيار توزيع المكافآت الجماعية إلى قيمة واحدة. هذه العملية تساعد على الحفاظ على التباين الذي يحتاجه تحسين السياسة.

أظهرت التجارب التي أجريت على مجموعة بيانات HotpotQA باستخدام نموذج Qwen2.5-3B-Instruct نتائج مثيرة. حيث كان أداء CIGPO في تحقيق نسبة F1 قياسية تبلغ 0.518، مقارنة بأفضل نتائج سابقة بلغت 0.430. وتعكس هذه القفزة الملحوظة تحسنًا بنسبة 105% عن الأساس الذي كان 0.252.

لقد تم تحديد انهيار تباين المكافآت كآلية فشل ملحوظة في نماذج التعلم القائم على النتيجة فقط، وبيّنت النتائج أن مكافآت قراءة الأدلة على مستوى الدور يمكن أن تمنع هذا الفشل، مما يتيح لوكلاء الذكاء الاصطناعي تحسين أدائهم بشكل ملحوظ.