في ظل تزايد استخدام المساعدات الذكية في المحادثات متعددة المواضيع، يبدو أن التحدي الأكبر الذي يواجهه الباحثون هو كيفية إدارة الذاكرة بشكل أكثر فعالية. حيث غالبًا ما تتخطى المحادثات القضايا والمعلومات المتعلقة بمسارات سابقة، مما يُظهر الحاجة إلى نظام أفضل للتعامل مع هذه الفوضى.

لقد أطلق الباحثون نموذج SCALE-QA، وهو معيار اختبار مبتكر يهدف إلى تقييم كيفية تعامل الأنظمة مع المحادثات غير المنقطعة التي تمزج العديد من المواضيع في وقت واحد. يتحدى هذا النموذج الأنظمة الحالية، ويعمل على قياس أداء الذاكرة من خلال أسئلة تتطابق مع الأحداث السابقة في الحوار، مما يسهل الاستنتاجات المعقدة.

يتضمن نموذج SCALE-QA مجموعة من 3000 سؤال تمت مراجعتها عبر 10 مجالات، ويعتمد نظام تصحيح يتضمن خيارات متعددة. كما يشتمل على أداة زمنية-دلالية تُعيد بناء الذاكرة بطريقة مُنسقة، مما يُعزز دقة النظام في التعامل مع المعلومات السابقة.

أظهرت التجارب أن نظام TSIM، الذي يعيد تنظيم المحادثات إلى حلقات متماسكة، يحقق أفضل دقة في جميع الإعدادات، محققًا زيادة في النقاط تصل إلى 17.6 فوق أقوى الأنظمة الحالية. هذه النتائج تدل على تقدم ملحوظ في الذكاء الاصطناعي وكيفية تفاعله مع المحادثات المعقدة.