في العديد من سير العمل المتعلقة بالمراجعة، يُحتفظ فقط بالحكم، بينما تُفتقد الفقرات الداعمة له، لكون تكلفة التعليق على هذه الفقرات أعلى بكثير من تكلفة تسجيل القرار. في دراسة جديدة تم قياس قدرة نموذج لغة صغير على استرجاع جزء من تلك الأدلة عندما يتم تدريبه بعد الحكم فقط، ودون وجود تسميات بشرية في أي مرحلة.

عند استخدام مجموعة بيانات تسمى ContractNLI، تم الاحتفاظ بالفقرات الداعمة لدى البشر إلى حين التقييم. وملاحظة مطابقة الحكم المسجل مع تلك الفقرات ليست بالشيء السهل؛ حيث أظهرت نتائج التقييم عبر ستة أنظمة أن الدرجات كانت مرتبطة بشكل ضعيف ورجعت أنظمة تصنيف مختلفة، مما يجعل تحديد الدقة عاملاً ضعيفاً عندما يتطلب الأمر مراجعة الاقتباسات.

التدريب على أساس الحكم فقط أحرز دقة تبلغ 0.896 ونسبة F1 بلغت 0.564. بينما تقنية اختيار الرفض، التي تحتفظ بمسار الناتج فقط عندما يتطابق حكمها مع السجل، وذاتها تسجل درجة تلقائية، حققت دقة قدرها 0.797 ونسبة F1 0.556، بينما كانت الأرقام قبل التدريب 0.747 و0.493 على التوالي.

شهدت الاقتباسات الحرفية زيادة من 0.597 إلى 0.729 بموجب التدريب القائم على الحكم فقط، بينما شهدت زيادة إلى 0.701 تحت اختيار الرفض. ربما تكون عينة واحدة من مجموعة بيانات واحدة غير كافية لتحديد أي الطرق أفضل، ولكن كلا الطريقتين أظهرتا تحسناً في استرجاع الأدلة دون الحاجة لأي تعليقات من جانب البشر.