في عالم يتسم بالتنافس الشديد، تصبح المعايير القابلة للتحقق لنماذج اللغات الضخمة (LLMs) ضرورة ملحة لبناء سمعة المؤسسات وجذب العملاء. ومع ذلك، لقد أظهرت التجارب أن الاعتماد على نظام الشرف قد يؤدي إلى عواقب وخيمة كما حصل عندما أثرت ادعاءات عدم التحقق حول أداء نموذج DeepSeek R1 مقارنةً مع OpenAI's o1، مما أدى إلى فزع كبير في السوق في 27 يناير 2025 عندما فقدت Nvidia 589 مليار دولار من قيمتها السوقية.

بحسب الدراسة الجديدة، فإن تقييمات نماذج اللغات الضخمة لا تزال تعتمد بشكل كبير على التقارير الانتقائية والأداء الغير موثوق، مما يبرز أهمية وجود آليات للتحقق من البيانات بشكل مستقل. وقد أجرى الباحثون اختبارًا باستخدام سبعة نماذج منفصلة لتقييم الفدائيات، بما في ذلك GPT-OSS 120B وLlama 3.3 70B. استخدمت الدراسة 58 سؤالًا عامًا، منطقيًا، سياسيًا، واستنادًا إلى التفضيلات، بينما أظهرت النتائج أن كشف الهوية قد يؤثر على درجات الإجابات، خاصة في التطورات السياسية.

كما تم تقديم بروتوكول قائم على البلوكشين لضمان موثوقية النتائج، حيث تسجل كل نموذج ليلةً سابقةً من تقييماته، مما يوفر مسار تدقيق يمكن تتبعه يحسن عملية التحقق ويسهل عمل الباحثين المستقلين. إن اعتماد مثل هذه الأساليب يساعد على تقوية الثقة في تقارير الأداء، ويدعم الابتكار ويحقق مستويات جديدة من الشفافية في الصناعة.