في عالم الذكاء الاصطناعي، لا تتوقف المعلومات المخزنة في النماذج اللغوية عند مجرد الإجابات التي تولدها. دراسة حديثة أشارت إلى أن تحليل البنية الداخلية لهذه النماذج قد يكشف عن ثروة من المعلومات التي تظل مختبئة. تنبه هذه الدراسة إلى خطر تسرب المعلومات، حيث يمكن للمستخدمين استخراج معلومات لم يكن صاحب النموذج يتوقع أن تكون متاحة.

باستخدام نماذج الرؤية واللغة (Vision-Language Models) كحقل اختبار، تم إجراء مقارنة منهجية للمعلومات المحتفظ بها عبر مستويات تمثيلية مختلفة. يتم ضغط المعلومات الغنية المخزنة في التيار المتبقي (Residual Stream) من خلال عنق زجاجة طبيعي: يتم تعريفه بواسطة الإسقاطات منخفضة الأبعاد التي يتم الحصول عليها باستخدام عدسات مضبوطة، بالإضافة إلى القيم العليا (Top-k logits) التي من المحتمل أن تؤثر على إجابة النموذج.

تشير النتائج إلى أن حتى الحدود القابلة للوصول بسهولة، كما هو محدد بقيم logits العليا للنموذج، يمكن أن تكشف عن معلومات غير مرتبطة بالمهام، حيث في بعض الحالات، يكشف عن معلومات تعادل تلك التي تم الحصول عليها من الإسقاطات الكاملة للتيار المتبقي. هذه النتائج تعد تنبيهاً مهماً لمجتمع الذكاء الاصطناعي حول المخاطر المحتملة لتسرب المعلومات في التطبيقات العملية للنماذج اللغوية.