في خطوة ثورية نحو استخدام الذكاء الاصطناعي في التعليم، أجريت دراسة جديدة حول تقييم الواجبات الفيزيائية المكتوبة بخط اليد بواسطة نموذج GPT-5.5. تمت مراعاة معايير صارمة لضمان دقة التقييم من خلال تحليل 10,364 صفحة تمثل 520 مهمة كتبها 416 طالباً. لقد تم تنظيم التقييمات عبر ثلاث مراحل، من ضمنها امتحان النظرية للأولمبياد الفيزيائي الوطني، ومخيم الاختيار النهائي للأولمبياد، وامتحان ميكانيكا الكم الجامعي.

واحدة من النقاط المحورية في هذا البحث كانت مقارنة الدرجات التي حصل عليها الطلاب مع الدرجات الرسمية. النتائج أظهرت توافقًا عاليًا للغاية، حيث كانت معامل تماسك الدرجات يصل إلى 0.91-0.97. وهذا يعني أن تقييم الذكاء الاصطناعي لم يكن مجرد اجتهاد، بل كان قادراً على استعادة التقييمات ذاتها التي منحتها لجان التحكيم البشرية، مما يعكس دقة النموذج وقدرته على فهم المعايير.

ولا يخفى على أحد أن عملية تقييم الواجبات العلمية، خاصة في التجارب العملية، تستوجب درجة عالية من الدقة، ولهذا قامت الدراسة بتحليل النتائج بعد جولة التقييم الأولى لتصحيح أي تناقضات، وتوفير تعليمات أكثر دقة على كل صفحة للحد من عدم الدقة.

باستخدام نماذج تقييمة مرنة ومعايير محدثة، يمكن للذكاء الاصطناعي أن يصبح أداة فعالة كقارئ ثانوي أو كأداة لمراجعة الدرجات، مما يوفر دعمًا حقيقيًا لهيئات الاختبار لتحقيق نتائج دقيقة وموثوقة.