في عالم يتزايد فيه الاعتماد على نماذج اللغة الضخمة (Large Language Models) والتي أظهرت أداءً رائعًا على المعايير القياسية، تبقى مسألة مدى توافق هذه النماذج مع توقعات المستخدمين قيد الدراسة. فهل فعلاً تلبي هذه النماذج ما ينتظره المستخدمون؟

أظهرت المقاربات الحالية لتقييم النماذج، والتي تعتمد على معايير خوارزمية أو تقييمات من خبراء، أنها قد تفشل في التقاط التنوع والدقة المطلوبة لتوقعات البشر الحقيقية. وعليه، تظهر النماذج كفؤة، رغم أنها قد لا تتماشى بالضرورة مع ما يصبو إليه المستخدمون.

وقد تم تقديم أول دراسة ممنهجة لدراسة توقعات المستخدمين في تفاعلات نماذج اللغة الضخمة في العالم الحقيقي. حيث تم اقتراح إجراء مبدئي لاستخراج توقعات غنية دلاليًا، وتم تقديم أداة nova تحمل اسم ExpectBench، وهي معيار يستند إلى توقعات المستخدمين الواقعية.

تشير التحليلات إلى أن النماذج الحالية تواجه صعوبة في تلبية وتوقع ما يأمل المستخدمون في الحصول عليه، مما يسلط الضوء على مصدر أساسي للاختلال في التوافق. استنادًا إلى هذه الملاحظات، تم تقديم إطار عمل خفيف يحمل اسم LENS، والذي يمكن النماذج من استيعاب توقعات المستخدمين وتوليد استجابات أفضل توافقًا، مما يؤدي إلى تحسين مستمر في رضا التوقعات ويسلط الضوء على أهمية النمذجة الصريحة لتوقعات المستخدمين لتحقيق توافق واقعي بين الأفراد والذكاء الاصطناعي.