في عالم الذكاء الاصطناعي (Artificial Intelligence)، يمثل تقييم القضايا الرياضية باستخدام نماذج اللغات الضخمة (Large Language Models) تحدياً كبيراً. غالباً ما تؤدي تلوث البيانات إلى تقليل موثوقية تقييم هذه النماذج، مما يقوض قدرتها على تقديم إجابات دقيقة للمسائل الرياضية. ومع ذلك، تمثل RePro (Proof-Verified Benchmark Rewriting) خطوة ثورية في هذا المجال.

ففيما تسهم الطُرق التقليدية في تقليل الظواهر الفردية من خلال إعادة كتابة التقييم، إلا أنها تفتقر إلى الضمانات التي تتعلق بصحة المسائل وموثوقية الإجابات. ومن هنا، يأتي دور RePro، أول إطار يدمج بين المحللات الآلية للنظريات القائمة على Lean في إعادة كتابة المعايير، مما يسمح بإعادة صياغة المسائل وتوليد إجابات صحيحة مضمونة بواسطة براهين مدققة.

تشير التجارب التي أجريت على مجموعات بيانات GSM8K وMATH إلى أن النسخ المعاد كتابتها بواسطة RePro حققت 100% في درجة التعريف الجيد والصلاحية وصحة الإجابات. بينما لا تزال الأساليب التقليدية تنتج حالات غير صحيحة أو غير مدروسة.

علاوة على ذلك، تظهر عدة نماذج تراجعاً في الدقة عند تقييمها باستخدام المعايير المعاد كتابتها التي تم التحقق من صحتها عبر البراهين، مما يوحي بأن أدائها قد يكون حساساً للتغيرات السطحية والبنائية، وقد يعكس جزئياً آثار الحفظ.

للاستفادة من هذا التطور الملهم، يمكنكم زيارة رابط الكود المصدر والبيانات على GitHub لمعرفة المزيد حول هذا الإطار المبتكر.