في ظل الاعتماد المتزايد على التكنولوجيا في تغيير نمط حياتنا، بدأ الباحثون في استخدام نماذج لغوية متعددة الأنماط (Multimodal Large Language Models) لفهم كيفية إدراك الناس لبيئاتهم الحضرية. يُعتبر فهم هذه التصورات أمراً بالغ الأهمية لتخطيط شامل وجميعنا يسعى إلى مدن آمنة ومترابطة.

تتزايد التحديات أمام الأساليب التقليدية التي تعتمد على الاستبيانات، والتي قد تكون مكلفة وصعبة النطاق. لذا، قرر فريق البحث استكشاف ما إذا كان يمكن لنماذج اللغة متعددة الأنماط تقييم السلامة المتصورة في البيئات الحضرية باستخدام صور الشوارع.

باستخدام قاعدة بيانات Place Pulse 2.0، أجرينا تقييمًا لأربعة نماذج، بما في ذلك نماذج مفتوحة ومملوكة، عبر 56 مدينة. تركزت التجارب على محاكاة محايدة وأنماط سكانية تختلف حسب الجنس والعمر والعرق. وقد أظهرت النتائج أن جميع النماذج الأربعة أظهرت قدرة متقاربة في التقييم مع درجات F1 تتراوح بين 65% و69%، واستبقت تنوعًا ملحوظًا بين المدن.

ومع ذلك، كان من الملحوظ أن النماذج تميل بشكل منهجي إلى تصنيف السلامة في العادة، مما يعني أنها كانت تُقلل من تصورات عدم الأمان وتقلل الفروقات بين المدن. حيث اتفق الشرح المقدم من النماذج على مجموعة من العوامل البصرية مثل الصيانة، والخضرة، والنظام، والطابع السكني الذي يدعم تصنيفات السلامة.

بينما أظهرت أنماط الشخصية تأثيرات ملحوظة حيث تميل الأنماط النسائية إلى التصنيف بشكل أكبر كغير آمن مقارنة بالذكور. كما أظهرت الأنماط العمرية تأثيرات تعتمد على النموذج، إلا أن الأنماط المتوسطة عادة ما كانت الأقرب إلى المحايدة. كيف يمكن أن تؤثر هذه النتائج على طريقة تصميم مدننا بشكل أكثر أمانًا وشمولية؟