في عالم التعليم الأكاديمي، تمثل امتحانات نهاية الفصل تحديًا كبيرًا من حيث الوقت والموارد. غالبًا ما تستهلك الامتحانات الطويلة مئات الساعات من عمل المصححين المؤهلين، مما يجعل من نماذج اللغات الكبيرة (LLMs) بديلًا مغريًا. دراسة جديدة تسلط الضوء على هذه الفكرة، حيث تم تقييم امتحان عملي في علوم الرؤية الحاسوبية باستخدام نماذج متنوعة.

ظهرت النتائج مثيرة، إذ تمكن أفضل نموذج لغوي من الوصول إلى متوسط خطأ مطلق يبلغ 1.64 من 35، وهو أقل من 2.61، وهو متوسط خطأ المصححين البشريين. لكن هنا يكمن التحدي الرئيسي: تكمن المشكلة في طبيعة التوجيهات المقدمة للمصحيحين الآليين. عندما تم استخدام مقدمة "مصحح صارم"، ابتعد 14 من 17 نموذجًا من نماذج الوزن المفتوح عن نطاق الدرجات المقبولة، مما أدى إلى إيقاف تقييم ثلاثة منها تمامًا.

تعود هذه الأضرار إلى جملتين تحجبان ائتمان الدرجات وليستا إلى أسلوب الكتابة أو حجم النموذج. على سبيل المثال، الجملة "لا تعطي نقاط جزئية" كانت كافية لإيقاف عمل نموذجيين من ثلاثة. بينما حافظت النماذج المغلقة من ثلاثة مزودين على دقتها تحت هذا الضغط.

ثم جاءت المرحلة التالية من الدراسة، حيث تم تقييم امتحان مستقل آخر في التعلم الآلي مع أكثر من 1000 طالب. أظهرت النتائج أن المقدمة الصارمة أدت إلى تدهور أداء عشرة نماذج، لكن في نفس الوقت حسنت أداء سبعة نماذج أخرى مما أدى إلى تجاوز الحدود المتوقعة.

لحل هذه المشكلات، تم استخدام تقنيات الضبط الخفيف (Light LoRA) للعلاج، مما ساعد خمسة نماذج صغيرة على الوصول إلى مستوى الدرجات البشرية. وبفضل هذه الدروس، تم إطلاق مجموعة بيانات مجهولة المصدر، والتي تشمل أيضًا جميع العمليات المتعلقة بالتقييم، والتدريب، والتحليل.

هل تعتقد أن استخدام نماذج الذكاء الاصطناعي هو مستقبل تقييم الامتحانات؟ شاركنا رأيك في التعليقات!