في مجال الذكاء الاصطناعي وتطبيقاته، تمثل نماذج اللغات الضخمة (Large Language Models) خطوة طموحة نحو تحقيق تفاعلات طبيعية مع الآلات. ومن بين هذه الجهود، تظهر JOR-Bench كأداة تقييم جديدة تستهدف تحديد كفاءة هذه النماذج وسرعتها في حل مشاكل البحوث التشغيلية باللغة اليابانية.

تتضمن JOR-Bench خمسة معايير تقييم على اللغة اليابانية، والتي تعتبر ترجمة لمعايير إنجليزية مشهورة، مثل IndustryOR، MAMO Complex LP، NL4OPT، OptiBench، وOptMATH. تغطي هذه المعايير مجتمعة 1,319 مشكلة متنوعة تشمل البرمجة الخطية، والبرمجة المختلطة الصحيحة، والبرمجة غير الخطية، وتحسين الحلول المجمعة.

تحقق الدراسة من أداء سبع نماذج للغات، ومنها نماذج متعددة اللغات ونماذج مخصصة للغة اليابانية، من خلال مقارنتها بين النسخ الأصلية الإنجليزية والنسخ الجديدة اليابانية. واستخدم الباحثون واجهة Python لمعايير OR-Tools لجعل النتائج قابلة للمقارنة والدقة. وأظهرت النتائج أن قدرة النماذج على صياغة حلول المشاكل لا تتأثر كثيرًا بلغة الإدخال، حيث كانت نسبة الخطأ بين اللغتين -0.3 نقطة مئوية فقط.

ومع ذلك، كشفت التحليلات عن اختلافات دقيقة في الأداء عبر اللغات، بما في ذلك حالات الفشل في توضيح المعاني العملية لبعض النماذج، حيث كانت النتائج موجهة نحو قيم المتغيرات بدلاً من القيمة الجدولية عند استخدام اللغة اليابانية. في النهاية، يعكس JOR-Bench التقدم الكبير في تقييم الذكاء الاصطناعي ومدى تأثير اللغة في أداء النموذج، مما يفتح آفاقًا جديدة للبحث والتطوير في هذا المجال.