تتطرق الأبحاث الحديثة إلى مفهوم "حكمة الحشود" وكيف يمكن تطبيقه في عالم نماذج اللغات الضخمة (Large Language Models). في دراسة جديدة، تم تقييم القدرة التنبؤية لـ15 نموذجاً على 254 سؤالاً يتعلق بسوق التنبؤات، مما أثار تساؤلات حول أداء النماذج متى كانت قيد الاستخدام الجماعي. وقد أظهرت النتائج أن الطرق المتعلمة، مثل الشبكة العصبية متعددة الطبقات (multilayer perceptron) والانحدار اللوجستي (logistic regression)، قد تفوقت على جميع نماذج اللغات الفردية وأيضاً على الطرق التقليدية.

الغريب في الأمر أن الانحدار اللوجستي أظهر قدرة على المطابقة مع الشبكة العصبية، مما يوحي بأن فوائد التجميع المتعلم تأتي من تعلم تركيبة خطية لمخرجات نماذج متعددة بدلاً من التفاعلات غير الخطية. كما أعيد تطبيق الانحدار الرمزي (symbolic regression) على التوزيع المتعلم للشبكة العصبية واستخرج إشارة نقية تبرز تباين النموذج كأبسط صيغة مفيدة.

بالإضافة إلى ذلك، وجدت الدراسة أن التلوث الناتج عن نقاط توقف التدريب يشكل عائقاً كبيراً، حيث انخفضت الفجوة الواضحة في القدرة بين نماذج السحابة المتطورة والنماذج المحلية الأصغر من 35.8% إلى 8.9% في مجموعة أسئلة نظيفة بعد نقاط توقف التدريب لجميع النماذج، مما يدل على أن تقييم النماذج الفردية أظهر فقط استقراراً معتدلاً. حتى عند تقييم سوق التنبؤات عند نقطة قطع كل نموذج من التدريب، لا تزال نماذج اللغات الضخمة أقل دقة بشكل واضح، مما يشير إلى فجوة حقيقية في تجميع المعلومات الجماعية.

تقدم هذه الاكتشافات مؤشرات قوية على أن تجمعات نماذج اللغات الضخمة يمكن أن تعكس آثار حكمة الحشود، لكن من الضروري إجراء تقييم خالٍ من التلوث للحصول على تقييم موثوق ودقيق.