في عالم الذكاء الاصطناعي، تواصل نماذج اللغة الكبيرة (Large Language Models - LLMs) تقديم أداء مذهل في سيناريوهات متعددة التفاعلات. ومع ذلك، تبقى الحاجة ملحة لفهم سلوك هذه النماذج في سياقات مختلفة وفوق فترات زمنية طويلة. هنا تأتي أهمية دراسة جديدة تستخدم اختبار تأجيل الإشباع المستلهم من تجربة حلوى ستانفورد الشهيرة، لتحديد أداء الوكلاء المتعددين تحت قيود وضغوط مختلفة.

من خلال تطوير نموذج صغير يعتمد على تفاعل الوكلاء، تستخدم التجربة أدوات للتحكم في الميزانية في كل خطوة، بينما يتم التلاعب بالتفاصيل الاجتماعية (كالظهور في البث أو العزلة) وخصائص الشخصيات (كالعمر والدافع الحسي). يتيح هذا النموذج تحليل النتائج باستخدام تقنيات متقدمة مثل منحنيات البقاء (Kaplan-Meier - KM) والنماذج متعددة المراحل على مدى زمن طويل.

تظهر النتائج أن العديد من الوكلاء يظهرون دافعًا كبيرًا للأكل في البداية، إذ يبقى حوالي 75.9% منهم حتى النهاية. ومن المثير للاهتمام، أن العزلة تقلل من المخاطر مقارنةً بالبث، في حين أن الالتزام باستخدام الوسائل الاستفهامية المعينة يزيد من المخاطر. يُفضّل الوكلاء طرح نحو 7.12 سؤالًا، ويحققون الحد الأقصى من الميزانية في 6% من الدقائق.

تتضح أهمية هذه الدراسة في إيجاد طريقة فاعلة لرصد سلوكيات النماذج تحت ضغوط اجتماعية متباينة، مما يقدم قاعدة بيانات قابلة للتكرار لتحليل الأداء في بيئات متعددة الوكلاء على المدى الطويل.