تعتمد فعالية النماذج الذكية (AI Models) في استنتاج المعلومات على قدرة الاستعلامات (Probes) في تحديد ما تمثله هذه النماذج. إذا كانت الحالات الخفية لنموذج ما تستطيع التنبؤ بمتغير معين، فإنه يُعتبر أن النموذج يمثل هذا المتغير. ومع ذلك، فإن تقييم الاستعلام، مثل القيمة $R^2$ والتي تصل إلى 0.6، قد تعكس فقط ما يكشفه المدخل بالفعل، ويمكن أن تعني نفس النتيجة أشياء مختلفة على بيانات مختلفة.

نقترح قراءة كل تقييم استعلام مقابل نقطتين مرجعيتين: الأدنى، وهو مدى ما تتوقعه مجموعة بسيطة من المدخلات، والأعلى، ما تستطيع جميع المدخلات التنبؤ به. الفجوة بينهما، المعروفة باسم 'الرأس الغير مُستخدم' (Headroom)، تمثل النطاق الذي يمكن أن يُظهر فيه الاستعلام أن النموذج يحسب شيئًا يتجاوز المدخلات البسيطة.

ثبتنا أن الرأس الغير مُستخدم يتلاشى بطريقتين: عندما يتوقف الهدف عن الاعتماد على متغير خفي يجب على النموذج استنتاجه، أو عندما تتوقف المدخلات عن إظهاره. لقد اختبرنا ذلك باستخدام نماذج التحويل (Transformers) المدربة لتحليل البيانات في السياق، حيث يجب عليها استنتاج التباين الخفي بين الدراسات لتوزنها بشكل صحيح.

تحت تأثير تغير البيانات، انخفضت نقاط الاستعلام وارتفع خطأ التنبؤ بمعدل يتراوح بين 12 إلى 15 مرة، ومع ذلك استعاد النموذج جزءًا مشابهًا من الرأس الغير مُستخدم، مما يدل على أن البيانات فقدت معلومات، وليس التمثيل. ثم حللنا النماذج الحقيقية، حيث يقوم النموذج الأساسي scGPT بتشفير التباين البيولوجي جزئيًا فقط. كما قمنا بإعادة تقييم أربع دراسات مؤثرة في استعلام نماذج اللغات الضخمة (LLMs)، التي تدعي أن النماذج تمثل الجغرافيا، حالة لوحة Othello، الحقائق، وسمات مستخدميها. مقارنةً بالنقطة الأدنى التي تم حسابها بناءً على نص المدخلات فقط، فإن بعض هذه الادعاءات تحتفظ بصحتها، بينما يتم تفسير أخرى إلى حد كبير بواسطة النص نفسه.