في عالم الذكاء الاصطناعي، تعتبر صعوبة الأسئلة (Question Difficulty) إحدى الخصائص الأساسية التي تحدد القدرة على التمييز بين النماذج ذات القدرات المختلفة. وفي دراسة جديدة، تم اقتراح منهجية قائمة على البيانات تتيح لنا فهم العوامل المؤثرة في صعوبة الأسئلة بشكل أعمق.

بدلاً من الاعتماد فقط على رقم تشير إلى مستوى الصعوبة، يمكننا الآن تفصيل ما الذي يجعل سؤالًا معينًا أكثر تحديًا من آخر. باستخدام نظرية استجابة العناصر (Item Response Theory)، قام الباحثون بتقدير صعوبة الأسئلة من ردود مجموعة كبيرة من نماذج اللغات الضخمة (LLMs).

بعد ذلك، تم عينة مجموعة من الأسئلة السهلة والصعبة، حيث تم استغلال نموذج لغوي لتوليد تفسيرات محتملة حول الفروق في الصعوبة بين الأسئلة. تم التحقق بعد ذلك من هذه التفسيرات وتم اختيارها بناءً على أداءها مع أسئلة جديدة لم تُستخدم في التدريب.

أظهرت النتائج التجريبية عبر ثلاثة مجموعات بيانات، تغطي مجالات مثل الرياضيات والمنطق والمواقف الشائعة، أن المنهج الذي تم اتباعه يمكنه إنتاج فرضيات قابلة للتفسير وقابلة للتنبؤ. على سبيل المثال، يمكن استخدام هذه الفرضيات لتوقع صعوبة الأسئلة الجديدة، وأظهرت نتائج مذهلة مقارنةً بالأنظمة الموجودة.

علاوةً على ذلك، يُظهر البحث إمكانية تعديل الأسئلة وفقًا للفرضيات المستخرجة، مما يتيح نقل الصعوبة في الاتجاه المتوقع. هذا يعكس أن الفرضيات المستنتجة تعتبر عوامل صعوبة صحيحة، لا مجرد وصفات لاحقة.

بهذا، لا تحول منهجية البحث العلامات التقليدية للصعوبة إلى بيانات وصفية فحسب، بل تساعد أيضًا في تطوير وتعديل الأسئلة بشكل فعال لتحقيق نتائج أفضل.