تسعى نماذج رؤية اللغة (Vision-Language Models) بشكل متزايد إلى تحصيل الإجابات على الأسئلة متعددة النماذج، إلا أن قدرتها على إعادة بناء الهياكل المكانية الخفية من صورة واحدة لا تزال تشكل تحديًا كبيرًا. في هذا السياق، نقدم لكم StateSight، معيارًا مبتكرًا تم تصميمه بعناية لاستكشاف أداء نماذج الذكاء الاصطناعي في هذا المجال.
يتميز معيار StateSight بكونه تقدميًا في تصميمه، حيث يقدم تحديات تتعلق بعمليات التفكير والعد، مثل فهم كيفية احتساب عدد المكعبات المخفية وترابط العناصر المكانية. يتضمن كل مجموعة من المهام 300 نموذج لمهام تعتمد على صورة واحدة مع تسميات مفصلية دقيقة.
عند تحليل الأداء، سجل نموذج OpenAI GPT-5.5، باستخدام معرف نموذج API gpt-5.5، دقة مذهلة تصل إلى 59.3%، 33.3%، و28.3% عبر المهام الثلاث. في حين أن نموذج Claude Sonnet 5 جاء بدقة أقل، حيث حقق 53.3%، 18.7%، و7.3%.
ومع ذلك، أظهرت النتائج أن أداء البشر في نفس الاختبارات، حيث اجتاز 30 مشاركًا 60 عنصرًا، جاء أعلى من كلا النموذجين، بدقة متوسطة بلغت 80.8%، 68.8%، و64.3%. هذه الفجوة تشير إلى أهمية العوامل البشرية في تقييم المهام المعقدة.
تتضمن النتائج تحليلًا عميقًا للأخطاء المتكررة خلال عمليات استعادة الحالة البصرية، مما يسلط الضوء على الحاجة لتطوير أدوات أكثر فعالية. ودعمًا لهذه الجهود، قدمنا أيضًا مجموعة بيانات جديدة تحت عنوان StateSight-Steps تحتوي على 900 مثال مختلط من الصور والنصوص، مما يعزز من تجارب التعلم الآلي.
ببليوغرافية هذه المعايير والتحليلات، يمكننا أن نرى كيف يمكن للاستجابات التي تبدو صالحة من الناحية التنسيقية أن تخفي في الواقع الفشل في استعادة البنية المكانية اللازمة لاستخراج الاستدلالات البصرية القابلة للتحقق.
StateSight: كيف تعيد نماذج رؤية اللغة بناء الهياكل المكانية الخفية؟
تمتاز نماذج رؤية اللغة بقدرتها على التعامل مع الأسئلة متعددة النماذج، ولكنها تواجه تحديات في إعادة بناء الهياكل المكانية من صورة واحدة. نقدم لكم StateSight، معيارًا ثوريًا يلقي الضوء على هذه القضايا.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
