في عالم التعليم الحديث، تلعب المحاكاة الرقمية (Digital Simulations) دوراً بارزاً في توفير بيئات آمنة تسمح للمتعلمين بالتفاعل مع وكلاء من خلال أسئلة حوارية، مما يعزز من تجربتهم التعليمية. هذه المحاكاة تقدم فرصاً رائعة لتدريب معلمي المستقبل في سيناريوهات صفية حقيقية. ومع ذلك، تواجه هذه الأنظمة تحديات في تحليل الاستجابات تلقائياً، خاصةً عندما تتضمن أسئلة مفتوحة تتيح للمرشحين للتدريس التعبير عن أفكارهم.

في دراسة جديدة نُشرت على منصة arXiv، تم تقييم نماذج اللغات الضخمة (Large Language Models) مثل DeBERTaV3 وLlama 3، بهدف التعرف على سلوكيات المستخدمين في ردود المحاكاة الرقمية في تعليم المعلمين. تناول البحث عدة جوانب تتعلق بأداء هذه النماذج، حيث تم دمج أساليب مختلفة مثل zero-shot وfew-shot وfine-tuning.

اكتشف الباحثون اختلافات ملحوظة في أداء نماذج اللغات الضخمة، حيث أظهر Llama 3 أداءً أفضل في الكشف عن الخصائص الجديدة مقارنةً بـ DeBERTaV3، الذي عانى من تدهور في الأداء عند محاولة تحديد خصائص جديدة.

يمكن لتلك النتائج أن توفر دليلاً للباحثين الآخرين حول كيفية استخدام نماذج اللغات الضخمة لتقديم تقييمات آلية في المحاكاة الرقمية. في الأوساط التعليمية، وبالنظر إلى التغيرات المحتملة في الخصائص بناءً على هدف التعليم أو السيناريو المحاكي، يُفضّل استخدام Llama 3 كخيار مثالي لتحسين التجارب التعليمية.