في تطور مثير في عالم الذكاء الاصطناعي، كشف بحث جديد أن النماذج اللغوية الصغيرة يمكن أن تقيم الإجابات المفتوحة بنفس دقة النماذج الأكثر تكلفة، شريطة أن يتم استخدامها وفقًا لمعايير واضحة ومحددة. هذا المشروع، الذي يحمل اسم 'any-to-bench'، يعتمد على مبدأ مهم: يتم استيعاب المستندات المصدر مرة واحدة فقط، ومن ثم استخراج الأسئلة والمعايير الخاصة بها.

في التجربة، تم تقييم ستة تكوينات نموذجية فعالة من حيث التكلفة من عائلتين مختلفتين من النماذج، عبر ثلاثة مستويات من الجهد الفكري. كل تكوين قدّم إجابات على 24 سؤالًا مفتوحًا، وقام بتقييم كل ورقة إجابة ثلاث مرات، مما نتج عنه 3,456 درجة لكل سؤال. وتبين أن جودة الإجابة الذاتية كانت العامل الأكثر تأثيراً، حيث تفسر هوية الإجابة 95.6% من تباين الدرجات، في حين أن هوية المقيم تفسر فقط 0.2%.

علاوة على ذلك، أظهر البحث أن رفع مستوى الجهد الفكري للكاتب يمكن أن يؤدي إلى تغير في الدرجات يصل إلى 0.143 من العلامات الكاملة، بينما تعديل جهد المقيم يؤثر بشكل ضئيل للغاية.

هذه الدراسة تسلط الضوء على أهمية وجود معايير واضحة للتقييم، حيث توضح النتائج أن إزالة معايير التقييم تؤدي إلى فقدان الدقة في التقييم وزيادة الدرجات بشكل غير منطقي. بعبارة أخرى، لقد أثبت البحث أن المعايير هي ما تفصل التقييم عن ذكاء المقيم، حيث أن الجواب الرسمي يكاد يكون له الدور الأهم في العملية. لا توجد أدلة تشير إلى التفضيل بأطوال الإجابات أو تفضيل العائلات في التقييم تحت نظام يعتمد على المعايير.