في العصر الحديث حيث تتزايد أهمية البيانات الكبيرة، تظهر نماذج اللغة الكبيرة (LLMs) كأدوات أساسية لتحسين أبحاث الرأي العام. فبفضل هذه النماذج، يمكن للباحثين توقع ردود الاستبيانات بشكل مبكر، مما يساعدهم في تقليل التكاليف والوقت المرتبطين بالطرق التقليدية لجمع البيانات.

ومع ذلك، تواجه العديد من الأساليب الحالية تحديات كبيرة، حيث تعتمد أغلبها على بيانات بشرية من المجالات المستهدفة للتعديل أو الإلهام، وهو ما يتطلب جمع بيانات مكلفة ويثير مخاوف حول الخصوصية. في هذا السياق، يتناول البحث كيفية محاكاة الاستبيانات على مستوى المجموعات السكانية، باستخدام صور رمزية تم استنباطها من بيانات سلوكية عامة ومتنوعة.

أشار البحث إلى أن توليد صور رمزية تمثل فئات سكانية متباينة يمكن أن يؤثر بشكل كبير على جودة المحاكاة. على الرغم من ذلك، وُجد أن الصور المستنبطة من مصادر غير مرتبطة غالبًا ما تكون أقل فعالية من المحاكاة التي تستند فقط إلى معلومات ديموغرافية أساسية، بسبب عدم تطابق السكان.

تقدم النتائج رؤى مثيرة حول كيفية تحسين المحاكاة من خلال تخصيص الصور الرمزية للمجموعات السكانية المستهدفة بدقة، مما يعزز تAlignment. بالإضافة إلى ذلك، أظهرت البيانات أن استخدام بيانات الاستبيان من المجال المستهدف يؤدي إلى نتائج تجريبية أفضل مع زيادة المعلومات المتاحة من تاريخ الأسئلة، مما يدل على أن الأدلة السلوكية الأغنى تمكن استنباط الصفات الشخصية بشكل أكثر استقرارًا لتكون محاكاة الأسئلة غير المتوقعة أكثر دقة.