في سياق النمو المتسارع للاختبارات الكبيرة وتزايد الاعتماد على التوليد التلقائي للأسئلة، ازدادت المخاوف بشأن تكرار المحتوى غير المناسب، حيث تصبح العناصر المتكررة بشكل غير مقصود مشكلة واضحة. غالباً ما تفشل المقاييس التقليدية مثل BLEU أو تشابه كوساين في التقاط العناصر الهيكلية والدلالية الدقيقة التي تؤثر على الإدراك البشري للتكرار.

تقدم هذه الدراسة إطاراً ثنائي الأبعاد لتحليل التشابه في العناصر (Automated Item Similarity Analysis - AISA)، الذي يعتمد على نماذج لغوية ضخمة (Large Language Models - LLMs). هذا الإطار يقوم بتفعيل مفهوم التشابه من خلال عملية "تفكيك منظم" (Structured Decomposition) و"العلاقة الدلالية" (Semantic Relatedness).

تناولت التحقق السيكوميتري (Psychometric Validation) كيف أن المقاييس المشتقة من نماذج LLM تتطابق بشكل أوثق مع مؤشرات الاعتماد المحلي غير المناسب، مما يسفر عن تجميعات أكثر اتساقاً لعناصر الامتحان مقارنةً بالمقاييس التقليدية المعتمدة على النصوص.

تم تقييم الإطار بشكل أعمق من خلال تطبيقه في نظام الاختبارات المتكيفة باستخدام الحاسوب (Computerized Adaptive Testing - CAT). تكشف المحاكاة أن تضمين قيود التشابه المستندة إلى نماذج LLM في اختيار العناصر يحسن من استقرار التقدير ويقلل من التحيز مع الحد الأدنى من التكاليف المرتبطة بالكفاءة.

تؤكد هذه النتائج على الإمكانية الكبيرة لإطار AISA المدعوم بنماذج LLM في دعم تجميع البنوك القابلة للتوسع وتجميع الاختبارات المركزة على المحتوى، مما يتيح اختبارات متسقة عبر مختلف سياقات التقييم.