في خطوة جريئة نحو تعزيز تطوير البرمجيات، وكسر حاجز اللغة، تم إطلاق معيار البرمجة (Terminal-Bench-LILT) الذي يمثل نقطة تحول في كيفية تقييم وكالات البرمجة متعددة اللغات. هذا المعيار الجديد يتميز بمجموعة من 300 مهمة برمجة أصيلة تغطي مجموعة متنوعة من اللغات، بما في ذلك العربية، والتشيكية، والألمانية، والإسبانية، والهندية، واليابانية، والكورية، والصربية، والتركية، والصينية.

المسؤولون عن إصدار هذا المعيار أشاروا إلى أن معظم التقويمات السابقة لوكالات البرمجة كانت تجرى باللغة الإنجليزية فقط، مما لا يعكس الواقع الحقيقي لنشر البرمجيات المتعددة اللغات. وفي محاولة لمعالجة هذه الفجوة، تم تصميم المهام لتستهدف قضايا محددة تتعلق بتطوير البرمجيات في الأسواق غير الناطقة بالإنجليزية، مثل الدولرة، والترميز، وتطبيع النصوص، والعادات الثقافية.

المهام تم تأليفها من قبل مبرمجين ناطقين باللغة الأصلية، وتم التحقق منها من خلال عملية جودة متعددة المراحل. وقد أظهر تقييم لستة نماذج متميزة أن أقوى نموذج لم يحقق إلا نسبة نجاح تصل إلى 63.1%، مما يعني أن العديد من المهام لم تحل بواسطة أي نموذج. الأداء كان متغيرًا بشكل كبير حسب اللغة، ولم يتناسب مع ترتيبات الأداء العامة لمعايير البرمجة، مما يبرز أن الكفاءة البرمجية متعددة اللغات هي محور قدرة لم يتم استكشافه بشكل كافٍ حتى الآن.

إذا كنت مهتمًا بمعرفة المزيد، يمكنك الاطلاع على نماذج المهام المتاحة على [https://github.com/lilt/terminal-bench-lilt]. فما رأيكم في هذا المعيار الجديد؟ هل تعتقدون أن هذا سيفيد تطوير البرمجيات بشكل فعّال؟ شاركونا في التعليقات.