في عالمٍ حيث تلعب نماذج اللغات الضخمة (Large Language Models) دورًا متزايد الأهمية في تقديم المعلومات الحيوية في القطاع العام، يُعد الخطأ في الإرشادات أمرًا قد يؤدي إلى أضرار لا يمكن إصلاحها. هنا يأتي دور الإطار الثوري "CIVI"، الذي يمثل أول إطار يُعتمد لتشخيص إخفاقات وكالات البحث في المعلومات المدنية.

"CIVI" هو نموذج مبتكر مصمم لتقييم أداء عشرة من وكالات البحث الرائدة، حيث تمت مقارنة نتائجها مع الأداء البشري المدروس بشكل دقيق. وقد كشفت هذه العملية عن عدم قدرة أي من الوكالات المختبرة على الوصول إلى مستوى دقة الإنسان.

لم يكن التركيز مجرد قياس الدقة، بل شمل أيضًا تقييم معدل استدعاء البحث ودقة عدم البحث الانتقائية، بالإضافة إلى مدى تكرار الوكالات للاعتماد على مصادر حكومية موثوقة. ولتشخيص هذه الإخفاقات، قدم الباحثون نموذجًا آخر يُعرف باسم "ARISE"، الذي يقوم بتفكيك الإخفاقات إلى أربعة أنماط متبادلة الحصرية، تمت عزلها عبر تقنية إزالة المصدر.

وأظهرت النتائج أن 72.1% من جميع الإخفاقات المُلاحظة كانت ناتجة عن أسباب مرتبطة بجمع المعلومات بدلاً من الثغرات في المعرفة البارامترية للنماذج. هذه النتائج تبرز الحاجة الملحة لفهم كيف ومتى ومكان يحدث الخطأ، مما يعزز الاعتماد على نماذج أكثر دقة وموثوقية.

إن كان لديك أفكار أو آراء حول هذا الموضوع، فلا تتردد في مشاركتنا بها في التعليقات!