تُعد القدرة على تقدير هدف النظر (Gaze Target Estimation) من الصور في العالم الحقيقي تحدياً كبيراً ومهماً في مجال الذكاء الاصطناعي. غالباً ما تتطلب الطرق الحالية خطوات متعددة هشة ودخلات واضحة، مثل حدود الرأس ووضعية الجسم، مما قد يؤدي إلى أخطاء في الكشف تؤثر على النتائج النهائية. من أجل تجاوز هذه القيود، تم تقديم مهمة "Promptable Gaze Target Estimation" (PGE) كنموذج جديد يعتمد على تصور المفاهيم ويستخدم التعليمات النصية كمدخلات مرنة.

تتيح هذه التقنية للمستخدمين إدخال عبارات وصفية مثل "الولد في القميص الأحمر" أو "الشخص في النقطة [0.52، 0.48]" لتحديد الهدف المطلوب لتحليل gaze، مما يدمج بين تحديد موضع الموضوع وتقدير خط gaze بشكل أكثر تركيباً وسلاسة.

لقد تم تطوير محرك بيانات قابل للتوسع لتوليد مجموعة بيانات "Gaze-Co"، والتي تحتوي على 120,000 زوج من الصور عالية الجودة، تم تعيينها بتعليمات نصية. وقد أُطلق أيضًا نموذج "GazeAnywhere"، والذي يعتبر الأول من نوعه المصمم لمهمة PGE، ويستخدم كاشفاً معتمداً على نموذج "Transformer" لدمج الميزات من المُشفّرين المجمدة، ويقوم بحل ثلاثة مهام في وقت واحد: تحديد موضع الموضوع، وجوده في الصورة، وتقدير خريطة حرارة هدف النظر.

حقق نموذج GazeAnywhere أداءً رفيع المستوى على العديد من المعايير المرجعية لـ PGE، مما يضع قاعدة قوية لمواجهة تلك المهمة الجديدة، حتى في مجموعات البيانات المعقدة من العالم الحقيقي. لقد تم نشر "GazeAnywhere" على GitHub لإتاحته للمجتمع البحثي للاستفادة منه وتطويره.

بفضل هذه الابتكارات، يتجه مجال تحليل gaze نحو تحقيق نتائج أكثر دقة وسلاسة في استخدامها، مما يفتح آفاقاً جديدة للاستخدامات المحتملة في تجربة المستخدم، الأمن، والرعاية الصحية.

ما رأيكم في هذه التقنية الجديدة؟ هل تعتقدون بأنها ستحدث ثورة في الطريقة التي نفهم بها سلوك البشر من خلال تحليل gaze؟ شاركونا في التعليقات.