في خطوة مهمة نحو تحسين القدرة على تقييم نماذج اللغة الكبيرة (LLMs) المستندة إلى المعرفة باللغة الصينية، تم الكشف عن مجموعة بيانات جديدة تُعرف بمسمى Chinese Data-Text Pair (CDTP). تضم هذه المجموعة أكثر من 7 ملايين مثيل يتضمن نصوصًا باللغة الصينية متماشية مع حقائق موثوقة من قواعد المعرفة المعروفة (Knowledge Graphs).

تواجه التقييمات الحالية للحالات الصينية تحديات في الحكم على الفهم اللغوي العام وتقديم دعمٍ محدودٍ للمسائل المنطقية المُعقدة المتعلقة باللغة الصينية. ومع ذلك، فإن CDTP تهدف إلى تقديم مصادر تقييم أكثر دقة من خلال تقديم مجموعة بيانات تساعد في مهام عديدة مثل استكمال قاعدة المعرفة (KGC) وإجابة الأسئلة (QA) وتوليد النصوص من الثلاثيات (T2T).

إحدى التحسينات الكبيرة التي تقدمها هذه المجموعة هي عملية إنشاء متعددة المراحل تشمل تنقية المطابقة والتحقق اليدوي والتحقق من الأدلة الخارجية، مما يعزز من الاتساق الدلالي وموثوقية الحقائق. كما تأخذ المجموعة بعين الاعتبار العديد من الظواهر المتعلقة باللغة الصينية، مثل التعدد الدلالي وغموض تقسيم الكلمات، مما يساعد على تقييم الفهم الفعلي للحقائق المعقدة.

أظهرت التجارب مع نماذج مفتوحة المصدر ونماذج خاصة أن مجرد زيادة حجم النموذج لا يضمن الأداء الموثوق في هذه المهام المعقدة، بينما يُظهر التحسين تحت إشراف على CDTP تحسينات ملحوظة في الأداء داخل المجال وقدرة فائقة على التعامل مع متغيرات البيانات.

تتوفر مجموعة البيانات الجديدة هذه، بالإضافة إلى التعليمات البرمجية وبروتوكولات التقييم، كمصدر قابل لإعادة الاستخدام للمطورين والباحثين الذين يسعون لتطوير وتحسين نماذج اللغة الكبيرة المستندة إلى المعرفة في اللغة الصينية. تجمع CDTP بين التقييم الدقيق والتطبيق العملي، مما يجعلها أداة لا غنى عنها للباحثين والمطورين.