استناداً إلى دراسة شاملة، تشير النتائج إلى أن الأشخاص افترضوا أن القدرات المعرفية في تطوير نماذج اللغات (Language Models) ترتكز حول عامل ذكاء عام، مشابه للعوامل الموجودة لدى البشر. ولكن، هل تم اختبار هذا الافتراض بصورة كافية؟

في دراستنا، نستخدم مناهج تحليل العامل (Factor Analysis) لدراسة الذكاء في نماذج اللغات، على غرار كيفية دراسة علماء النفس للمفاهيم النفسية. قمنا بتحليل 13,251 درجة تقييم منشورة تغطي 1,618 نموذج لغوي عبر 456 معيار نصي فقط.

تشير النتائج إلى أن هناك عامل ذكاء عام يمثل نحو 70.8% من التباين في أداء النموذج، وهو ما يعتبر تقديراً سخياً. ومع ذلك، في كثير من الحالات، تكون هذه النسبة أقل بكثير. وجدنا أيضاً أن المعايير المتشابهة في المحتوى لا تتجمع بالضرورة في مجموعات محددة.

علاوة على ذلك، لا يُظهر عامل الذكاء العامة "$g$ factor" هيمنة أي موضوع شائع، وبالتالي، لا يوجد دليل قوي على أنه يمكن تمثيله بشكل جيد من خلال المعايير "الذكائية" القياسية. هذه النتائج تتعارض مع المساعي الحالية لتعريف وتحديد واستهداف الذكاء العام ككائن ملموس في تطوير نماذج اللغات.

الخلاصة، تدعو هذه النتائج إلى إعادة التفكير في استراتيجيات استهداف القدرة المفاهيمية الواحدة، حيث إن القدرات الأولى التي يجب الوصول إليها غالباً ما تكون خاصة جزئياً وغير قابلة للتحديد عملياً. هذه التحديات تثير تساؤلات حول الطريقة التي يمكننا بموجبها تقييم الذكاء الاصطناعي وتحسين نماذجه.