في عالم تعلم الذكاء الاصطناعي، يشكل اختبار البيانات غير الموسومة تحديًا كبيرًا لتقنيات تعلم التعزيز التقليدية، حيث تفتقر هذه التقنيات إلى مكافآت دقيقة تعكس أداء النموذج. في هذا السياق، قدم الباحثون مفهوم "مكافآت التوافق" (CoRE) كاستجابة مبتكرة.

تعمل الطريقة الجديدة على إدماج نتائج نماذج متعددة تقوم بتوليد الإجابات، حيث يتم تكوين رسم بياني من تلك الإجابات، بحيث يتم تجميع توافق الإجابات، وتوافق الاستدلال، وثقة النموذج في كل إجابة. من خلال استخدام ديناميكية المكرر، يمكن استنتاج مجموعة مهيمنة تحدد الإجابة الأكثر دقة، مع تقديم مكافآت لكل جولة من الاختبارات، مما يوفر أسلوبًا غير خاضع للإشراف ودقيق لتحسين التعلم.

تشير النتائج الإحصائية إلى أن "مكافآت التوافق" تحقق نتائج أفضل بنسبة 21.7 نقطة في المتوسط مقارنةً بأساليب التصويت التقليدية، وتتفوق في الكثير من الحالات حيث يكون الاتفاق مثيرًا للجدل بحدود تصل إلى 7.5 نقاط. كما يتم الوصول إلى مستوى دقة مكافآت التصويت الشائعة في 54-70٪ أقل من الخطوات التقليدية.

كذلك، تقدم هذه الطريقة طريقة جديدة في الرصد والتقييم، حيث تجعل من مجموعة النتائج رسمًا بيانيًا بدلاً من صندوق اقتراع، مما يحول التصويت الهش إلى مكافأة ذات درجة محسوبة ودقيقة دون الحاجة إلى تكاليف إضافية.