تواصل نماذج الرؤية واللغة الكبيرة (Large Vision-Language Models) تحقيق تقدم سريع في مهام الإدراك البصري، لكن واحدة من أبرز التحديات التي تعرقل هذا التقدم هي ضعف الأداء في التفكير المكاني. هذا النقص يصبح ملحوظاً بشكل خاص عند التعامل مع الأسئلة التي تتطلب تفكيراً معقداً حول الفضاء المرئي.
في الفترة الأخيرة، تم تطوير أساليب جديدة للتفكير المكاني تعتمد على إجراءات تسميتها «التوجيه الأرضي» (grounding)، والتي تتيح للنماذج تنبؤ أطر العمل أو الأقنعة أو أي مخرجات موضعية للأشياء ذات الصلة بالمهام. ومع ذلك، تعاني هذه الأساليب من مشكلة حيث أنهم يركزون فقط على دقة الإجابة النهائية، مما يسمح بتوزيع المكافآت لإجابات صحيحة حتى عندما لا تستند إلى أجسام ذات صلة تم تحديدها بثقة.
هنا يبرز الابتكار الجديد: SpatialCORE (التفكير المكاني المعتمد على الثقة). يمثل هذا النظام إطاراً لتدريب النماذج يقدم فكرة مركزية تتمثل في استخدام ثقة النموذج في أدائه كإشارة للتعلم. حيث يقوم بتعزيز الأسس التي تتمتع بدقة وثقة عالية، مما يشجع النموذج على التفكير من الأجسام ذات الصلة المحددة بثقة.
تحقق SpatialCORE هذا من خلال مكافأة مكانية ذاتية التنظيم تعزز جودة توافق كل إطار عمل مستنداً على ثقة توكن التنسيق. ويدعم هذا النظام بشكل إضافي ربط الأمثل للتوجيه بدقة الإجابة النهائية، مما يحقق نتائج فريدة من نوعها بين النماذج المفتوحة والمتخصصة.
بالإضافة إلى ذلك، يوفر SpatialCORE نتائج مذهلة عبر مجموعة متنوعة من الاختبارات، ويظهر كفاءة في نقل التعلم في إعدادات غير مرئية لبيانات لم يسبق رؤيتها من قبل. وللمزيد من التفاصيل، يمكنك الاطلاع على الشيفرة المصدرية عبر هذا الرابط.
ما رأيكم في هذا التطور الجديد في عالم الذكاء الاصطناعي؟ شاركونا في التعليقات!
SpatialCORE: تعزيز الثقة في التفكير المكاني لنماذج الرؤية واللغة!
تمكنت نماذج الرؤية واللغة الكبيرة (LVLMs) من تحقيق تقدم ملحوظ، ولكن الصعوبة في التفكير المكاني لا تزال قائمة. يقدم SpatialCORE نظاماً مبتكراً يعزز الثقة في النتائج، مما يحسن من دقة الإجابات الفكرية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
