في عالم تتزايد فيه استخدامات نماذج اللغات الضخمة (LLMs)، أصبح تقييمها يكتسب أهمية متزايدة، خاصةً عند التعامل مع أسئلة مفتوحة حيث يكون نوع الإجابة متوقفًا على سياق السؤال. تواجه الطرق التقليدية في التقييم، مثل الدرجات الثنائية (Binary Scores) وغيرها، صعوبات كبيرة في التقاط احتياجات التقييم المرتبطة بسياقات معينة.

مع ظهور الابتكار الجديد، Qworld، تُطرح حلاً مبتكراً يقوم على تقديم معايير تقييم خاصة بالسؤال نفسه. تعتمد هذه الطريقة على شجرة توسيع تكرارية (Recursive Expansion Tree)، حيث يتم تحليل السؤال إلى سيناريوهات، ووجهات نظر، ومعايير ثنائية دقيقة.

عند تطبيق Qworld على تقييم نماذج مثل HealthBench، أظهرت النتائج أنها تغطي 89% من معايير التقييم التي وضعها الخبراء وتولد 79% من المعايير الجديدة التي تم التحقق منها من قبلهم. وعلى الرغم من أن الطرق السابقة كانت تحمل معايير عامة، إلا أن Qworld تمكّن من تسليط الضوء على الفروق في الإمكانيات بين النماذج، مثل التأثير طويل الأمد، والعدالة، وإدارة الأخطاء، والتفكير بين التخصصات.

بهذا الشكل، تتيح Qworld عملية تقييم أكثر دقة تلبي احتياجات كل سؤال على حدة، مما يشير إلى عصر جديد من التقييمات المتقدمة لنماذج اللغات الضخمة. فهل يمكن أن تغيّر Qworld مشهد الذكاء الاصطناعي كما نعرفه اليوم؟