في عالم تصميم الألعاب، يُعتبر استنتاج تفاعل اللاعبين من خلال مقاطع الفيديو أمراً بالغ الأهمية. تسعى دراسة حديثة إلى تسليط الضوء على قدرة نماذج اللغة المرئية (Vision Language Models - VLMs) في فهم الحالات النفسية الكامنة لدى اللاعبين من خلال الإشارات المرئية فقط.

استخدمت الدراسة مجموعة بيانات GameVibe Few-Shot عبر تسعة ألعاب shooter من منظور الشخص الأول، حيث تم تقييم ثلاث نماذج VLM وفقاً لست استراتيجيات ترويج مختلفة، بما في ذلك التنبؤ المباشر (Zero-Shot Prediction) والاستراتيجيات المدعومة من نظريات مثل Flow وSelf-Determination Theory.

النتائج أظهرت أن التنبؤات التي أجرتها نماذج VLM في حالة zero-shot عادةً ما كانت ضعيفة، وغالباً ما فشلت في التفوق على البيئات البسيطة التي تعتمد على الفئة الرئيسية لكل لعبة. بينما أظهرت استراتيجيات الترويج المعززة بالذاكرة أو الاسترجاع تحسنًا في التنبؤ المباشر في بعض الإعدادات، كانت التنبؤات المقارنة بين الفترات الزمنية دائماً صعبة.

أحد الملاحظات المثيرة في الدراسة كان أن الترويج المدعوم بنظريات معينة لم يكن مفيداً دائماً، بل يمكن أن يعزز من الطرق السطحية في الفهم.

خلاصة القول، تكشف هذه النتائج عن فجوة واضحة بين إدراك وفهم نماذج VLM الحالية؛ على رغم قدرتها على التعرف على إشارات اللعب المرئية، إلا أنها لا تزال تواجه صعوبة في استنتاج تفاعل الإنسان بشكل موثوق عبر جميع الألعاب. فهل نحن أمام تحدي جديد في الذكاء الاصطناعي في مجال الألعاب؟