تعتبر نماذج اللغة الكبيرة (Large Language Models - LLMs) من الأدوات الفعّالة في تقييم جودة النصوص، حيث تتجاوز أحياناً المقاييس التقليدية التي تعتمد على النصوص المرجعية. ومع ذلك، فإن هذه النماذج تعاني من ظاهرة تُعرف بالتحيز في التقييم، حيث تُظهر تنبؤات معينة بغض النظر عن سياق النص المُقيم.

في دراسة جديدة نُشرت في arXiv، تم اقتراح طريقة مبتكرة لمعالجة هذا التحيز. حيث يعتمد الأسلوب المُقترح على تعليم النموذج لتوليد رموز رقمية عشوائية، مما يسمح بتحديد التحيز الخفي عبر قياس انحراف التوزيع الملحوظ لأرقام معينة عن التوزيع المتساوي.

تضيف الدراسة تعريفاً لمهمة لاحقة يُستخدم فيها المقيم، وذلك لتوليد أرقام عشوائية تقيس تحيز الأرقام الخاص بالمهمة المحددة. من خلال هذه الطريقة، يتم تصحيح احتمالات توليد الرموز للنموذج بناءً على تحيز الأرقام الخفي.

أظهرت النتائج المستخلصة من التجربة التي شملت أربع مهام مختلفة، بما في ذلك تقييم مواءمة النماذج وتلخيص النصوص، أن الطريقة المُقترحة تتفوق بشكل ملحوظ على الأساليب السابقة، بما في ذلك تلك التي لم تخضع للتعديل والتصحيح. كما أكدت الدراسة على أن التحيز في التقييم يختلف عبر نماذج اللغة ومهامها ومدى التقييم، مما يبرز أهمية قياس التحيز الخفي كحالة شاملة.