في الآونة الأخيرة، شهدت تطورات كبيرة في نماذج اللغات الضخمة (LLMs) واعتماد أنظمة استخراج المعرفة (RAG) في الصناعة، مما أدى إلى ظهور حاجة ملحة لمجموعات بيانات خاصة بالمجالات تتعلق بتقييم أداء هذه الأنظمة على بيانات خاصة.

حينما تُعد مجموعات البيانات الحالية مثل HotpotQA، فإنها تتحدى أنظمة RAG الحالية اعتمادًا على المعرفة المستندة إلى ويكيبيديا، لكنها تفتقر إلى القدرة على نقل هذه التحديات إلى إعدادات المجالات المحددة. لذا، فإن تقييم الجودة الفعلي لأنظمة RAG يتطلب وجود استفسارات متعددة الخطوات بالإضافة إلى أسئلة غير قابلة للإجابة.

هنا يأتي مشروع TRIAD، والذي يمثل نهجًا مبتكرًا يتكون من ثلاث مراحل لتوليد مجموعة بيانات تقييم أوتوماتيكية. في المرحلة الأولى، يتم إنشاء أزواج سؤال-جواب (QA) تتعلق بقاعدة المعرفة الخاصة بمجال معين. في المرحلة الثانية، يقوم مُدقق بالتحقق من كل زوج QA ضمن حلقة تغذية راجعة. وأخيرًا، يتم توسيع الأزواج QA مع مستندات سياقية محددة تُصنف من حيث الصلة لتقييمها في الاستخدامات التالية.

تم تقييم هذا الأسلوب الجديد مقابل مجموعتي بيانات معروفتين، MuSiQue وHotpotQA، وكشفت النتائج أن مجموعة البيانات التي تم توليدها تمتاز بأنماط أداء مشابهة عبر إعدادات RAG المختلفة. كما أظهرت نتائج التحقق البشري أن الأسئلة المطروحة مناسبة لتقييم أنظمة RAG المخصصة.

لمن يرغب في استكشاف هذه التقنية الثورية، يمكنك العثور على الكود المستخدم في توليد مجموعة البيانات وجميع نتائج التحقق في مستودع GitHub الخاص بالمشروع.