في خطوة مبتكرة نحو تحسين سلامة المرور، يركز الباحثون على استغلال تقنية الرؤية الذاتية (Egocentric Vision) لكشف نوايا عبور المشاة. تعتبر هذه التقنية فريدة من نوعها، حيث تتيح الحصول على منظور من الشخص نفسه حول كيفية إدراك البشر لمحيطهم واتخاذ القرارات.
تتمحور الدراسة حول تحليل مقاطع الفيديو القصيرة التي تصور المشاة في سياقات مختلفة. هنا، تصبح العملية عبارة عن حل لمشكلة إجابة الأسئلة البصرية المغلقة (Visual Question Answering - VQA) باستخدام نماذج اللغة البصرية (Vision Language Models - VLMs) للمساعدة في توقع نوايا عبور المشاة.
خلال التجربة، تم اختبار ثلاثة عائلات من نماذج VLM المتقدمة في سيناريوهات مختلفة. ورغم أنهم حققوا تحسينات متوسطة مقارنة بالتخمين العشوائي، إلا أن الأمر أظهر أن لديهم قيوداً في قدرة التفكير المعقد حول حركة المرور.
ومع ذلك، دفع هذه النتائج الباحثين لتطوير نماذج VLM من خلال تعديل فعال للمعلمات، حيث أظهرت النتائج أن النماذج المعدلة تفوقت بشكل واضح على النماذج بدون تعديل، محققة زيادة دقة بنسبة 9% مقارنة بنموذج التحويل المتخصص.
ولتحقيق نتائج أفضل، تمت إضافة معلومات سياقية مثل حركة العين وحركة المركبات، مما كان له تأثير إيجابي كبير على الأداء التنبؤي. فقد أظهر نموذج Qwen3-VL-2B المعدل، الذي استند إلى حركة العين وحركة الذات، تحسناً في الدقة بنسبة 14.5%، مما يمثل إنجازاً جديداً في مجال فك شيفرة نوايا المشاة.
هذه التطورات تدعو للتفكير: كيف يمكن لرؤية المشاة أن تسهم في جعل الشوارع أكثر أمناً؟
كسر حاجز السلامة: فك شفرة نوايا عبور المشاة من خلال الرؤية الذاتية باستخدام نماذج اللغة البصرية
استكشاف طموح الرؤية الذاتية في تحديد نوايا عبور المشاة يفتح آفاق جديدة لسلامة المرور. دراستنا تظهر كيف يمكن لنماذج اللغة البصرية تحسين دقة التنبؤ بنوايا المشاة بشكل ملحوظ.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
