تشهد نماذج اللغة الكبيرة (Large Language Models) انتشاراً متزايداً في مساعدتنا بحياتنا اليومية. ومع ذلك، فإن المعايير الحالية لا تعكس دائماً الطلبات الحقيقية التي نحتاجها. فالكثير من الطلبات الواقعية تكون مفتوحة، وغير محددة بدقة، وتعتمد على السياق. وهنا يأتي دور معيار xDailyBench الجديد.

xDailyBench هو معيار مبتكر يتضمن 248 مهمة تم انتقاؤها بعناية، تمتد عبر 51 سيناريو متنوع متعلق بالحياة الشخصية، والأعمال المكتبية، والتعليم، والبحث، والنشاطات متعددة المجالات. تم تصميم هذه المهام بناءً على الطلبات التي قام المستخدمون بها فعلياً، وتم تقييمها وفقاً لمعايير دقيقة تشمل كل من المتطلبات الصريحة والضمنية.

بعد اختبار 11 نموذجاً رائداً وفقاً لإعدادات موحدة، أظهر أفضل النماذج درجة أعلى تصل إلى 75.6% في تلبية المهام. ومع ذلك، كان أداء جميع النماذج أسوأ بشكل ملحوظ في تلبية الاحتياجات الضمنية مقارنة بالتعليمات الصريحة، مع وجود فجوات تصل إلى 9 نقاط مئوية. تُظهر هذه النتائج أن استنتاج المتطلبات الضمنية يمثل عائقاً مستمراً أمام تلبية احتياجات المستخدمين في الحياة اليومية بشكل موثوق.

في ضوء هذه النتائج، يظهر السؤال: كيف يمكن للذكاء الاصطناعي المساعدة في فهم احتياجاتنا بشكل أفضل؟