تعد القدرة على التفكير الرياضي إحدى المهارات الأساسية التي يحتاجها الأفراد، وخصوصاً في عصر تتزايد فيه أهمية الذكاء الاصطناعي. لكن، كيف يمكن لنماذج اللغات البصرية (Vision Language Models) أن تتعامل مع مسائل الرياضيات التي تستند إلى معلومات مرئية بدلاً من النصوص؟ هذا هو السؤال الذي طرحته دراسة جديدة قدمت معيار GSM8K-V.
في هذه الدراسة، تم تحويل معيار GSM8K المعروف إلى سلسلة من الصور متعددة الأبعاد مع الحفاظ على المعنى الدلالي، مما يتيح تقييم مقارنة مختلفة. تم إعداد ما يقرب من 1,319 عينة عالية الجودة، حيث يجب استخراج الكميات والتعابير الرياضية من خلال الإحساس المرئي بدلاً من قراءة الرموز مباشرة.
تم تقييم 34 نموذجاً للغات البصرية، ووجد الباحثون فجوة ملحوظة في الأداء: إذ تخطت معظم النماذج 90% في المسائل النصية، بينما لم يتحقق أفضل نموذج سوى 59% في GSM8K-V، وهو أداء أقل بكثير من دقة البشر التي تبلغ 91%. هذا العمل يكشف عن التحديات التي تواجهها هذه النماذج بسبب الأخطاء الناتجة عن فشلها في استنتاج المعاني المرئية الضمنية التي يحتاجها الحل.
أتت النتائج لتؤكد أن نماذج الرياضيات المعززة لا تؤدي أداءً أفضل على معيار GSM8K-V، مما يشير إلى أن هذا المعيار يقيم قدرة فريدة تستحق الدراسة والتطوير. في النهاية، تم نشر الكود والبيانات للعامة على GitHub، مما يفسح المجال للباحثين والمصممين لاستكشاف هذا الموضوع المهم.
هل تعتقد أن نماذج الذكاء الاصطناعي ستكون قادرة على تحسين أدائها في حل مسائل الرياضيات المعقدة المرتبطة بالصور في المستقبل؟ شاركونا آراءكم في التعليقات!
GSM8K-V: هل تستطيع نماذج اللغات البصرية حل مسائل الرياضيات المدرسية في سياقات مرئية؟
تقدم GSM8K-V معياراً جديداً يختبر قدرات نماذج اللغات البصرية في حل مسائل الرياضيات في سياقات مرئية. تكشف النتائج عن فجوة كبيرة في الأداء بين النماذج والبشر، مما يشير إلى تحديات كبيرة في الفهم المرئي.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
