في عالم الذكاء الاصطناعي، تُعتبر نماذج الرؤية واللغة (Vision-Language Models - VLMs) من الإنجازات البارزة في مهام تعرف الكائنات البصرية (Optical Character Recognition - OCR). لكن، يبدو أن هذا النجاح يُخفى وراء نقاط ضعف حقيقية. في دراسة حديثة، تم تطوير مجموعة بيانات مبتكرة تُدعى DecoyBench، تستخدم أسلوب Decoy Font، مما يكشف عن قيود خطيرة في هذه النماذج.
تتكون مجموعة البيانات من 300 صورة تحمل نصوصًا ذات خطوط محددة بوضوح فوق نصوص أخرى ذات تظليل ناعم. وقد تم اختبار ستة نماذج مغلقة المصدر ضمن ثلاث عائلات مختلفة باستخدام هذه المجموعة، تحت حالتين مختلفتين من التوجيه (naive وguided) وعند دقتين مختلفتين (512×512 و64×64).
البشر المشاركون في التجربة تمكنوا من قراءة كلا الطبقتين النصيتين بدقة عالية، بينما عانت النماذج من مشاكل واضحة. النماذج فقط استطاعت أن تقرأ نصوط الطبقة المحددة بدقة قرب الإنسان في الدقة العالية، لكنها فشلت في استخراج نصوص الطبقة المتظليلة. أما عند الدقة المنخفضة، فلم تتمكن لا النماذج ولا البشر من قراءة نصوص الطبقة المحددة بشكل واضح، لكن النص المتظلل كان قابلًا للاستخراج بدقة عالية.
تشير هذه النتائج إلى أن نماذج VLMs تظهر حدودًا سلوكية مستقرة عندما تتعامل مع الهياكل الطباعية التي تحتوي على طبقات تردد مكاني متعددة. فكيف سيؤثر ذلك على تطويرات الذكاء الاصطناعي في المستقبل؟
ما رأيكم في هذا التطور؟ شاركونا في التعليقات.
روبوتات الرؤية واللغة: كيف تكشف الهجمات الطباعية النقاط الضعيفة؟
تظهر دراسة جديدة أن نماذج الرؤية اللغوية (VLMs) ليست فعالة في التعرف على النصوص في الصور متعددة الطبقات. بينما يستطيع البشر قراءة الطبقات بوضوح، تعتبر هذه النماذج عرضة لمشكلات كبيرة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
