في ظل الانتشار الواسع للمحتوى المسيء عبر الإنترنت، تزايدت الحاجة إلى أنظمة موثوقة لاعتدال النصوص على وسائل التواصل الاجتماعي في الصين. تعد النماذج الحالية التي تعالج هذا النوع من المحتوى ببساطة غير كافية، حيث تركز على تصنيفات محددة دون تقديم تمثيل موحد يمكن من التحقق بشكل دقيق من أساسيات قرارات الاعتدال. هنا تأتي الابتكارات مع إصدار VARM-Bench، وهو معيار جديد يركز على تقديم مبررات منطقية متسلسلة ومترابطة للتعامل مع خطاب الكراهية.

يتضمن VARM-Bench بيانات تحتوي على مبررات بلغة طبيعية، مع نقاط مرجعية واضحة لستة قرارات: الهدف، نوع الهدف، مدى وضوح الهدف، موقف الكاتب، تصنيف الضرر، والتصنيف الدقيق. تهدف هذه الأداة إلى تقييم دقة القرارات بشكل موحد، حيث تتيح للمستخدمين القدرة على التحقق من دقة النتائج دون الاعتماد على نماذج اللغة الكبيرة (LLMs).

هناك جانب تحليلي آخر حيث يقوم VARM-Bench بتقييم النماذج اللغوية عبر عدة أسر محددة باستخدام تقنيات التوجيه التنظيمي والإشراف المنظم للإنتاجيات. تكشف النتائج أن الأداء القوي في مستوى التصنيف قد يُخفي أخطاء كبيرة في سجلات الاعتدال الكاملة.

تعتبر هذه الأداة بمثابة نقطة تحول في مجال تقييم معتدلي خطاب الكراهية في الصين، حيث توفر معيارًا يمكن التحقق منه وقابلًا للتكرار، مما يعزز الشفافية والمصداقية في عملية الاعتدال.