في السنوات الأخيرة، أصبحت أنظمة الذكاء الاصطناعي تعتمد على مجموعات بيانات كبيرة ومتنوعة من أجل تحسين أدائها. ولكن، لم يكن التركيز دائماً منصباً على ملاءمة هذه البيانات لظروف النشر الفعلية. هنا يأتي دور منهجية جديدة تُعرف باسم TTCov (Test-Time Coverage)، والتي تسعى إلى تغيير الطريقة التي يتم بها معالجة البيانات بحيث تتوافق بشكل أكبر مع ظروف النشر.

تتميز منهجية TTCov بأنها تستخدم معلومات مُستندة إلى الاختبارات قبل مرحلة التدريب، بدلاً من تحديث أوزان النموذج خلال مرحلة الاستدلال. وهذا يوفر فرصة لتحسين عملية اختيار البيانات بشكل أكثر دقة. لذلك، تقوم ريالتي بتفكيك معالجة بيانات النشر إلى قسمين رئيسيين: التغطية والتوزيع.

لتوضيح مفهوم التغطية، تقوم منهجية TTCov بإنشاء خريطة معرفية (Atlas)، والتي تضم مجموعة من المفاهيم ذات الصلة بالنشر المستندة إلى نماذج لغوية ضخمة (Large Language Models). هذه الخريطة يتم تكوينها استناداً إلى المعرفة المفتوحة وتُوسَّع بالمفاهيم الجديدة المستخلصة من عينات نشر غير مُصنفة.

أما بالنسبة للتوزيع، فتقوم منهجية TTCov بتجميع المفاهيم ذات الصلة بالنشر مع التكرارات الخاصة بها، مما ينتج عنه خريطة معرفة (Knowledge Atlas - K-Atlas) التي تعكس توزيع البيانات المستهدفة عند النشر.

وأخيرًا، يتم اختيار مجموعة بيانات تدريبية تتناسب توزيعها مع التوزيع المستهدف من K-Atlas. تم استخدام منهجية TTCov في مجال القيادة الذاتية، حيث أثبتت كفاءتها في اختيار بيانات تتسم بتغطية أكبر ومواءمة أقرب مع K-Atlas، مما يعزز الأداء النهائي في القيادة مقارنة بأساليب معالجة البيانات الحالية.