في عالم الذكاء الاصطناعي، يمثل "تحفيز الإدراك" (affordance perception) مصطلحًا حديثًا يشير إلى القدرة على تحديد المناطق القابلة للتفاعل، سواء في البيئات ثنائية الأبعاد (2D) أو ثلاثية الأبعاد (3D). ورغم أن هذه المفاهيم المختلفة قد تطورت كمسائل منفصلة مع تعريفاتها المختلفة، إلا أن هذه التجزئة قد أدت إلى محدودية القدرة على نقل المعرفة إلى مجال آخر.

آلية "Token Router for Tasks" هي الحل الجديد الذي يقدمه نموذج UniAfford، حيث يسهل هذا النظام استجابة متعددة المهام لنماذج اللغويات الضخمة (MLLM) من خلال توجيه الحالات الخفية السياقية إلى فروع محددة بحسب المهام. وهذا يمكن النموذج من تلقي تغذية راجعة مباشرة من الأهداف الخاصة بالفرع، مما يؤدي إلى تحسين دقة النتائج.

وقد تم تطوير نموذج UniAfford كإطار عمل موحد لتمكين الإدراك القابل للتعميم بين 2D و3D. ويضاف إلى ذلك قاعدة بيانات UniAfford-Data التي تتضمن تفاعلات متعددة المستويات، تشمل ملاحظات ثنائية الأبعاد على مستوى البكسل ونقاط ثلاثية الأبعاد، مما يوفر دعماً شمولياً في إدارة البيانات.

تساعد خاصية "عناصر التوجيه" في تحقيق استجابة مرنة من الصور وبيانات النقاط، مما يتيح تفسيرًا مشتركًا للإدراك القابل للتفاعل، سواء كانت البيانات المقدمة ثنائية الأبعاد أو ثلاثية الأبعاد.

تظهر تجارب النموذج أداءً متفوقاً في التعميم بدون الحاجة لتعديل خاص على الأهداف المستهدفة، مما يشير إلى فعالية النموذج في بيئات مختلفة. تُظهر التجارب أيضًا قوة التوجيه بين الحالات المشتركة والعمليات المفصولة لفهم التحفيز بدقة.

بإجمال، تمثل UniAfford خطوة كبيرة نحو المستقبل في مجال رؤية الكمبيوتر، مما يعد بتحسينات ضخمة في كيفية فهمنا وتفاعلنا مع الأشياء من حولنا.