في وقت تتزايد فيه الحاجة إلى توقعات دقيقة تتجاوز الأرقام التقليدية، تمهيدًا لمستقبل يحمل في طياته تحولات في القدرة على تحليل البيانات، تقدم دراسة جديدة معيارًا موحدًا يطلق عليه اسم MUSE-Bench، يتميز بقدرته على دمج سياقات متعددة لتحسين نتائج التوقعات.

تستعرض الدراسة معوقات المعايير الحالية في تتبع البيانات الزمنية، حيث تبرز قصر نظر البيانات العددية ونقص المعلومات السياقية التي تعكس الديناميكيات الزمنية الفعلية. العديد من المعايير متعددة الأنماط تعاني من نقص البيانات والتغطية السياقية، مما يحتم الحاجة إلى نهج شامل ومتوازن.

يتميز MUSE-Bench بأربعة عشر مجموعة بيانات عبر ثمانية مجالات مختلفة، محافظًا على السياقات المتنوعة مثل البيانات الوصفية، والأحداث، والعطلات، والأخبار، والصور، والبيانات العددية. يتم تقييم نماذج التنبؤ المختلفة، بما في ذلك النماذج الإحصائية، والنماذج القائمة على البيانات، والنماذج المتعددة الأنماط، ونماذج لغة الكبيرة (Large Language Models) ضمن النوافذ التوقعية غير المتداخلة.

تكشف التجارب الشاملة ثلاث نتائج رئيسية: أولاً، تتفوق نماذج الوقت العددية على النماذج الأخرى، بينما يتضح أن النموذج المتعدد الأنماط Aurora يتخلف عن نماذج التوقعات العددية لكنه يتفوق على النماذج المحددة البيانات الأخرى. ثانيًا، تحسن السياق الخارجي أداء النماذج المعنية بالتحليل مع تأكيد أهمية التوافق الزمني للسياقات. أخيرًا، تظهر نتائج التجارب أن النماذج العامة المبنية على لغات كبيرة لا تقدم أداءً جيدًا كمؤشرات مباشرة رغم أنها تحتاج إلى تحسين مستمر.

يعد MUSE-Bench تقدمًا هامًا لتقييم كيفية استفادة النماذج من السياقات المختلفة، وكخطوة أولى نحو أبحاث مستقبلية في مجال التوقعات المتعددة الأنماط.