في عالم الذكاء الاصطناعي، تعتبر الروابط بين السمات عبر الحواس موضوعاً مثيراً للدراسة والبحث. في بحث جديد نُشر في arXiv، تم تحليل كيفية تفاعل البشر ونماذج اللغة المرئية (VLMs) عندما يتعلق الأمر بالاختيارات والاهتمام البصري.
تتناول هذه الدراسة مفهوم الروابط العابرة للحواس، مثل ذلك الارتباط بين اللفظة "bouba" والأشكال المستديرة، و"kiki" مع الأشكال الحادة. وبدلاً من استخدام مهام أو تنبيهات مختلفة، تم استخدام نفس المحفزات—كلمات وهمية وصورتين—لكلا الطرفين.
عبر دراسة مكونة من 53 مشاركاً، تم قياس اختياراتهم وحركات نظرهم. وفي نتائج مدهشة، وُجد أن هناك تطابق في خيارات بعض نماذج اللغة المرئية الكبيرة مع خيارات البشر. لكن للأسف، لم يكن الانتباه البصري لنماذج اللغة المرئية يتطابق مع نظرات البشر بنفس القدر الذي كان يتوقعه الباحثون.
وعند تحسين نماذج صغيرة عبر تدريبها على خيارات البشر، تم تحسين توافق الخيارات ليصل إلى مستوى الأغلبية لدى البشر، لكن الانتباه لا يزال بعيدًا عن تطابق نظرات البشر. هذا يشير إلى أن مجرد توافق الخيارات أو حتى نماذج النظر البشرية ليس دليلاً كافيًا على عملية معالجة عابرة للحواس تتماشى مع البشر.
الخلاصة، هذا البحث لا يبرز فقط الفجوة بين الذكاء الاصطناعي والتفكير البشري، بل أيضاً يحفز تساؤلات جديدة حول مستقبل تفاعل نماذج الذكاء الاصطناعي مع البيئة والمستخدمين. ما رأيكم في هذا التطور؟ شاركونا في التعليقات.
إكتشافات جديدة في الذكاء الاصطناعي: كيف يتفاعل البشر ونماذج اللغة المرئية مع البيانات؟
بحث حديث يكشف عن مدى تشابه اختيارات البشر ونماذج اللغة المرئية (VLMs) في الربط بين السمات المختلفة. الدراسة تقدم رؤى جديدة في معالجة البيانات عبر الحواس المختلفة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
