في عالم اليوم، حيث تشهد المدن تزايدًا مستمرًا في حركة المرور، يصبح التحكم في إشارات المرور (Traffic Signal Control - TSC) أولوية قصوى لتحسين التنقل وتقليل الازدحام. ومع كثرة الكاميرات المثبتة عند تقاطعات الإشارات، توفّر هذه الكاميرات معلومات بصرية غنية عن حركة المرور المتغيرة، إلا أن الطرق التقليدية لإدارة إشارات المرور غالبًا ما تعتمد على تحليلات يدوية مسبقة أو وحدات إدراك منفصلة. هنا يأتي دور VLALight، النموذج الأول من نوعه الذي يجمع بين الرؤية واللغة والإجراء (Vision-Language-Action - VLA) للتحكم الشامل في إشارات المرور باستخدام مقاطع فيديو متعددة الزوايا.

يقوم VLALight بربط الملاحظات البصرية مباشرةً مع إشارات التنسيق المقررة، من خلال إجراء تفكير مكاني زمني متعدد الأهداف وإدراك تعاوني مدرك للبيئة المحيطة. لتحقيق هذا الهدف، تم تطوير استراتيجية تدريب إشرافي على مرحلتين تركز على فهم حركة المرور البصرية واتخاذ القرارات المتعلقة بالإشارات، تتبعها طرق تعلم التعزيز التعاونية التي تعزز كفاءة المرور على مستوى الشبكات بأكملها.

ومن المثير للاهتمام أن VLALight يقدم أوضاع تفكير سريعة وبطيئة، مما يمكّن النموذج من تخصيص مزيد من التفكير فقط عندما يُضيف والقرار الإضافي فوائد ملموسة. من خلال تجربته المتوازنة وتحسين المزايا النسبية، يستطيع VLALight تحقيق توازن بين جودة القرار وتكلفة الاستدلال.

تظهر التجارب الواسعة على سبعة مجموعات بيانات حقيقية تدفق حركة المرور عبر ثلاث شبكات حضرية أن VLALight يتفوق باستمرار على الطرق التقليدية القائمة على النقل، وكذلك تلك المعتمدة على الذكاء الاصطناعي والتعلم العميق. ودراسات الإسقاط المؤقت تعزز من فاعلية الإدراك التعاوني، والتحسين على مستوى الشبكة، والتفكير التكيفي. هذه النتائج تعكس إمكانيات نماذج VLA في التحكم الفعلي بحركة المرور. تفضل بزيارة مشروعنا على GitHub: VLALight GitHub.