تعتبر مشكلة التشرد من التحديات الاجتماعية المستمرة التي تؤثر على الملايين حول العالم، حيث تم تسجيل أكثر من 876,000 شخص يعانون من التشرد في الولايات المتحدة الأمريكية لعام 2025. ومع وجود تحيز اجتماعي كبير يشكل عائقًا أمام إيجاد حلول فعالة، تبرز نماذج اللغة الضخمة (Large Language Models) كأداة واعدة لفهم وتصنيف هذه التحيزات.

توفر البيانات النصية على الإنترنت والخطابات في المجالس المحلية الإسقاطات التي تعكس وترسم ملامح الرأي العام حول قضايا التشرد. في هذا السياق، تم إصدار مجموعة بيانات فريدة متعددة المجالات تتعلق بالتحيزات تجاه المشردين، تتضمن 1,698 عنصرًا مصنفة بدقة، بالإضافة إلى 50,447 نصًا مُعَلَّماً بواسطة نموذج GPT-4.1. تم جمع هذه البيانات من منصات مثل Reddit وX (المعروف سابقًا بتويتر) وأخبار وكذلك محاضر اجتماعات المجالس البلدية على مدار عشر سنوات من 2015 إلى 2025.

ومن خلال تقييم ستة نماذج لغة مختلفة على مجموعة البيانات القياسية، تم اكتشاف أن الأنماط معدلة اعتباطيًا، حيث يُظهر التحليل وجود قفزات واضحة بين الدقة والقلق في تصنيفات الأنماط. كل نموذج كان يميل لتضخيم تعبير "ليس في حديقتي" (+11.5 نقطة مئوية) بينما كان يقلل من الكشف عن الادعاءات الواقعية (-30.5 نقطة مئوية). كما بين التحليل أن هذه النماذج تتعامل مع مصطلحات الإسكان وصيغ الأسئلة ك proxies للمعارضة، مما أدى إلى ارتفاع معدل الأخطاء في تصنيفات النصوص المؤيدة للخدمات.

تسهم هذه الدراسة في دعم السلطات المحلية لمراقبة وصم المشردين دون الاعتماد البسيط على تسميات المعلمين كحقائق نهائية. فتحليل هذه البيانات واستخدام نماذج اللغة قد يساعدان في فهم التحيزات وتوجيه السياسات نحو معالجة فعالة لقضايا المشردين.