في عالم مترو الأنفاق المزدحم، يبقى التواصل الفعّال مع نظام النقل أمرًا حيويًا. هنا يظهر MetroLLM-Bench، معيار جديد من نوعه يتضمن 955 حالة لاختبار نماذج اللغة (Language Models) كطبقة سياسية في أكشاك مترو الأنفاق. هذا النظام يغطي ستة أنظمة مترو حقيقية، تتراوح بين 37 إلى 414 محطة، وبأحد عشر فئة تشمل توجيه المسافرين، حساب الأجرة، التعامل مع الاضطرابات، ومواضيع الوصول، إضافةً إلى مدخلات عدائية.

تتطلب كل حالة من النموذج الاتصال بأدوات منظمة، وتقديم حالة نهائية قابلة للفهم من قبل الآلة، تتضمن النتيجة، وكود الأجرة لكل تذكرة عند الاقتضاء، وإجراء في الكشك. يتكون التقييم من أربعة عشر مكونًا حاسمًا يشكلون Tier 1، إلى جانب ثمانية مكونات لجودة دلالية في Tier 2، حيث يستخدم ستة منها قضاة من نماذج اللغة.

عند إجراء التقييم، تم اختبار ستة وعشرين نموذجًا من ستة مزودين، حيث تم تصنيف ثلاثة وعشرين منها. في الجزء المحجوز للتقييم، تفوق نموذج Qwen 3.5 الذي تم تدريبه باستخدام تحسين فعال للمعلمات (PEFT) على جميع نماذج GPT-5.6 في Tier 1. بالإضافة إلى ذلك، أشارت النتائج إلى أن النماذج الأكبر حجماً لم تحقق تحسنًا في الأداء عند مقارنة النتائج بمدارس التدريب.

Snapback analyses تظهر أن قاعدة قائمة على القواعد المنطقية حققت 84.6 في Tier 1، مع ميزة واضحة لنماذج اللغة في مجالات التكيف، السيناريوهات المركبة، الوصول، والمنطق الزمني. في الختام، يعد Muse Glimmer 30B هو الرائد في التصنيف المركب، حيث كان تحسين الإعدادات الخدمية للنموذج Qwen 3.5 نقطة فارقة في تحصيل النقاط. هذا المعيار والإرشادات متاحة على [https://github.com/continker/metrollm-bench].

ما رأيكم في دور نماذج اللغة في تحسين خدمات النقل العامة؟ شاركونا آراءكم في التعليقات!