في عالم يتزايد فيه الاعتماد على نماذج الذكاء الاصطناعي في معالجة السياسات والتقييم والتدريب، بات من الضروري أن تعكس المحاكيات البشرية المعتمدة على نماذج لغوية ضخمة (LLM) النماذج السلوكية الحقيقية بدقة.

حتى الآن، ركزت الأبحاث على قياس دقة السلوك في استجابات الاستطلاعات والحوار، ولكن النشاطات البشرية طويلة الأمد لم يتم تناولها بالشكل الذي تستحقه. لهذا السبب، تم تقديم إطار لتقييم دقة السلوك في محاكيات النشاط البشري التي تمتد على فترات زمنية متنوعة ومستويات تحليل متعددة.

كجزء من هذه الدراسة، تم جمع مجموعة بيانات تضم 43 ساعة من نشاط المكتب في العالم الحقيقي باستخدام عدة كاميرات، وقورنت الآليات المستندة إلى السجلات: أوصاف الشخصية، والمثاليات القليلة، والإحصائيات الانتقالية والزمانية.

تشير النتائج إلى أن دقة السلوك ليست متساوية عبر المقاييس المختلفة؛ حيث تجلب المبادئ الإحصائية توزيع النشاط والتسلسل الأقرب إلى السلوك الحقيقي، ولكنها قد تؤدي أيضًا إلى تقسيم غير متكافئ للروتين وتخفيف الفروق الفردية داخل الشخصية.

تدعو هذه النتائج إلى تقييم شامل يأخذ بعين الاعتبار عدة مقاييس وفترات زمنية ومستويات تحليل، مما يسهل تعزيز فهم أفضل للأداء السلوكي في المحاكيات المستقبلية.