في عالم العلوم، قد تبدو الأشكال والأنماط مجرد تفاصيل، لكن دراسة حديثة كشفت عن تأثيرها الكبير على تقييم الأفكار العلمية. تحت عنوان "تحقيق في نموذج القضاة من نماذج اللغات الضخمة (LLM) في توليد الأفكار"، نُشر في arXiv، تم الكشف عن أن القضاة من هذه النماذج يجدون صعوبة في التفريق بين الجوهر العلمي والتقديم الشكلي.

للتغلب على هذه التحديات، تم تطوير SciStyleBench، وهي مجموعة من الأدوات التي تتكون من ثلاثة مكونات رئيسية لمdiagnosis ومعالجة التحيز الأسلوبي.

1. **SciStyleStage**: بيئة تقييم مكونة من ثلاث مراحل تقوم بإجراء تعديلات على الأسلوب لصياغات علمية ثابتة، متوافقة مع ثلاثة إعدادات مختلفة.
2. **SciStyleMetrics**: مجموعة من القياسات الكمية، مثل مؤشر تحيز الأسلوب (Style Bias Index - SBI) ونسبة التعرف على الجوهر (Substance Recognition Rate - SRR)، تحدد كيفية تأثير التغييرات الأسلوبية على استقرار الدرجات.
3. **SciStyleExtractor**: وحدة تقييم تفصل بين الأسلوب والمحتوى العلمي، مما يساعد في تقليل التحيز الأسلوبي بشكل ملحوظ.

تظهر التجارب التي أجريت على SciStyleBench أن قضاة LLM ما زالوا حساسين للأسلوب، مما يشير إلى حاجة ملحة لتطوير التقنيات التي تضمن تمييزًا دقيقًا بين الجوهر والشكل، دون أن تتأثر التجربة التقييمية بالخلفيات الأسلوبية.