تسعى التقنيات الحديثة في مجال الذكاء الاصطناعي إلى الارتقاء بتجربة التفاعل بين الإنسان والآلة، حيث تُعتبر نماذج الوكلاء الحوارية مثل (Conversational MLLM Agents) جزءًا أساسيًا من هذه التطورات. ومع تزايد توقعات المستخدمين في تفاعل هذه النماذج في مجالات العمل الاحترافية مثل البحث العلمي، التصميم الهندسي، وإدارة المنتجات، تم إدراك نقص في القياسات الحالية التي تركز في اتصالات الحياة اليومية والمواقف غير الرسمية.

لذا، ظهر نموذج (DSV-Mem) كأسلوب جديد لتقييم الذاكرة البصرية الديناميكية في سياقات العمل الاحترافية، حيث يتعامل مع مجموعة من السيناريوهات المعقدة التي تتطلب تفاعلًا دقيقًا مع معلومات غزيرة تتعرض إلى تحديثات متكررة. يشمل هذا النموذج 1000 سؤال مقسمة على خمسة فئات تتعلق بولاية المستخدم الحالية والتغيرات التاريخية والمشكلات والموافقات.

تستند معايير التقييم الجديدة إلى التحليل البصري العميق وتتحدى قدرات النماذج الحالية، حيث تشير النتائج الأولية إلى أن النماذج تؤدي بفعالية أقل من 45% في معظم السيناريوهات. وقد أظهرت هذه الأبحاث أن من أبرز العوامل التي تؤثر سلبًا على الأداء، هي التطورات في الحالة وعدد التحديثات الحاكمة.

بتقديم هذا النموذج، يتم تعزيز مرونة الذكاء الاصطناعي في بيئات العمل مع توفير أدوات تقييم عامة ستكون متاحة قريبًا. الخطوة التالية ستكون حاسمة في إعادة تعريف كيفية تفاعل التقنيات الحديثة مع التحديات المهنية.