أعلن فريق GENAI4E عن تطوير إطار عمل رائد في مجال استخراج المشاة ذوي السلوكيات غير النمطية، والذي يُعتبر تحديًا كبيرًا في عالم الذكاء الاصطناعي. في هذا الإطار، يتم استخدام أوصاف نصية لاسترجاع المشاة من مجموعة كبيرة من الصور، وهي مهمة تتطلب قدرة على التحليل الدقيق لسلوكيات الأفراد، وتفاعلهم مع الأجسام الأخرى في المشهد.

تنافس هذا الإطار في تحدي AI City Challenge 2026، حيث يبدو أن الابتكار يكمن في مزيج يدمج نماذج الرؤية-اللغة المتنوعة (Heterogeneous Vision-Language Models) بشكل تدريجي. يعتمد النظام على نموذج قوي لاسترجاع البيانات، ويقوم بدمج النماذج من خلال عمليات محاذاة للنتائج ودمج تكراري للتقنيات، يليها إعادة تصنيف قائمة نتائج، مما يعزز التعامل مع الاستفسارات الغامضة.

من النتائج المثيرة للإعجاب لهذا الإطار، تحقيق دقة 90.92% في المتوسط المرجح للملاءمة (mAP)، و85.13% استرجاع@1، و97.72% استرجاع@5، و98.68% استرجاع@10 في معيار سلوك المشاة غير المعتاد (PAB). تظهر هذه النتائج بوضوح كيف يمكن أن يؤدي الجمع بين تمثيلات الرؤية واللغة إلى تحسينات كبيرة في الاسترجاع النصي للأشخاص.

مع هذا الابتكار، يبدو أن المستقبل ينذر بتطورات ثورية في كيفية تعاملنا مع تحديات تحديد السلوكيات الغريبة بين المشاة وكيف يمكن للذكاء الاصطناعي أن يسهم في تحسين هذه العمليات.