تسعى الأبحاث الحالية إلى تعزيز استخدام نماذج اللغة الكبيرة كقضاة (LLM-as-a-judge) لتقييم نتائج النماذج، ومع ذلك، لا توجد معايير واضحة تحدد كيفية تصميم هذه النماذج. عادةً ما يقوم الباحثون باختيار الأسئلة (prompts) ومقاييس التقييم (rating scales) والنماذج بشكل عشوائي، مما قد يؤدي إلى اختلافات في النتائج.

في سياق هذا البحث، قام الباحثون بدراسة 10 نماذج للتفكير عبر تصاميم متعددة في مهمتين: تقييم عواطف الجمل (over 500 items per category) وتصنيف دقة الأسئلة والأجوبة (n=600). رغم أن القضاة أظهروا عدم توافق كبير مع الحقيقة البشرية، إلا أن الاختلافات كانت صغيرة بما يكفي اعتبار معظم القضاة موثوقين، بمعدل انحراف مطلق متوسط قدره 0.11 نقطة على مقياس من 1 إلى 7. بالإضافة إلى ذلك، في مهمات تقييم السمية، تفوقت قضاة السمية على المصنفات القياسية، فيما حققت دقة متوسطة قدرها 96.5% في مهمات التصنيف.

ومع ذلك، فقد أظهرت خيارات التصميم إمكانيات لتحول النتائج: تغيير مقياس التقييم وحده يمكن أن يحدث تحولاً في التحيز بمقدار يصل إلى 0.93 نقطة، في حين أن مستوى دقة النماذج لم يتأثر كثيرًا، إلا أن خيارات التصميم كان لها تأثير مستمر على تسامح القضاة، والذي انخفض بمعدل 28.9 نقطة مئوية عند استخدام الأسئلة التفصيلية، و56.1 نقطة مئوية عند تغيير النماذج.

بشكل مفاجئ، لم يؤثر خفض مجهود التفكير على الدقة أو التسامح. إن هوية النموذج كانت المصدر الأساسي للاختلافات.

تظهر هذه النتائج أن القضاة باستخدام نماذج اللغة الكبيرة موثوقون بشكل عام، لكن خيارات التصميم يمكن أن تكون مصادر مهمة للاختلافات. نظرًا لأننا نرى تزايد الاعتماد على التقييمات المؤتمتة في أبحاث LLM، فإننا نعتبر هذه الدراسة كمرجع منهجي لتصميم خطوط أنابيب LLM-as-a-judge أكثر قوة وقابلية للتكرار.