في خطوة رائدة نحو تحسين أداء نماذج اللغات الضخمة (Large Language Models)، تم تقديم معيار جديد يُدعى CruxBench، الذي يختبر قدرة هذه النماذج على اكتشاف المعلومات ذات القيمة. يعتمد CruxBench على مفهوم "cruxes"، وهو تقسيم المشكلات المعقدة إلى أسئلة فرعية يمكن أن تسهم في حل المشكلة الرئيسية.

لأهمية هذه الوظيفة، يقوم معيار CruxBench بتقييم الأسئلة التي تقترحها نماذج اللغات الضخمة بناءً على قيمة المعلومات (Value of Information - VOI) التي تضيفها لتوقع إجابات الأدلة. يتمتع هذا المعيار بخصائص فريدة تشمل: مقاومة التلوث (contamination-resistant) حيث يتم إنشاء الحقيقة الموثوقة من أحداث المستقبل، وفتحه أمام إجابات غير محدودة ومعقدة بدلاً من إجابة رقمية صحيحة واحدة، بالإضافة إلى متانته، حيث يتم قياس المعلوماتية بناءً على التغيرات الكمية في المعتقدات الحقيقية.

تضمن البحث تقييم مجموعة متنوعة من ثمانية نماذج عبر 293 سؤالًا حول التوقع، وكشف أن قيمة المعلومات ترتبط بشكل عالٍ مع مقاييس القدرة المستقلة للنموذج (r=0.90) وتوضح كيفية تأثير "cruxes" على الإجابة على الأسئلة الأساسية. ومع ذلك، لا تزال عملية اكتشاف المعلومات تمثل تحديًا حتى بالنسبة لأحدث نماذج اللغات الضخمة والتي تفوقت بشكل ضئيل على قاعدة توقيت عشوائية.

تظهر هذه النتائج أهمية مراجعة الأساليب المستخدمة في التعلم العميق وتحليل مدى قدرة الآلات على التفكير النقدي واكتشاف المعلومات المفيدة بطريقة تساهم في الأسئلة الأكبر.