في عالم يتطور بسرعة، تلعب قواعد المعرفة العلمية (Scientific Knowledge Bases) دوراً محورياً في تسريع الاكتشافات البحثية. هذه القواعد تقوم بتجميع النتائج من الأدبيات الأساسية في صيغ هيكلية قابلة للبحث، مما يسهل على الباحثين البشريين وأنظمة الذكاء الاصطناعي الناشئة الوصول إلى المعلومات المطلوبة. ومع ذلك، يتطلب الحفاظ على هذه الموارد كفاءات عالية حيث يحتاج القيمون الخبراء إلى البحث في الأوراق العلمية، ومواءمة الأدلة عبر مستندات متعددة، وإنتاج توضيحات قائمة على الأنطولوجيا (Ontology).

ما يثير الاهتمام هو أن التقييمات التقليدية تركز على مهام فرعية معزولة مثل التعرف على الكيانات (Named Entity Recognition) أو استخراج العلاقات (Relation Extraction)، مما يجعلها لا تأخذ في الاعتبار سير العمل الشامل. هنا تأتي FlyAOC، حيث تقدم تقييمًا شاملاً لوكالات الذكاء الاصطناعي في تنظيم الأنطولوجيا من الأدبيات العلمية.

عند تزويدها برمز جيني (Gene Symbol) ووصف جيني مختصر يعود إلى FlyBase، وولوج إلى مجموعة بيانات تضم 16,898 ورقة علمية، وبالاعتماد على موارد الأنطولوجيا، تتحدى FlyAOC الوكالات للبحث عن الأدلة واسترجاع أكبر عدد ممكن من التعليقات الهيكلية ذات الصلة. تشمل النتائج مصطلحات دالة معيارية، أنماط التعبير، وأسماء تاريخية مرتبطة بأكثر من عقد من التسمية.

يجمع التقييم بين 7,397 تعليقًا تم تنسيقه بواسطة خبراء على مدار 100 جين مأخوذ من FlyBase، قاعدة المعرفة الخاصة بـ Drosophila. تُظهر النتائج أن FlyAOC حساسة لتصميم النظام المستخدم، عائلة النماذج، وموثوقية استخدام الأدوات. تكشف هذه النتائج عن طرق فشل على مستوى النظام لا يمكن تقييمها من خلال نماذج تقييم فردية فقط. تتيح FlyAOC بيئة اختبار قابلة للتكرار لتعزيز تنظيم المعرفة العلمية المدعومة بالاسترجاع.