في عالم الذكاء الاصطناعي المتسارع، تبرز الحاجة إلى نماذج قادرة على اتخاذ قرارات مرئية فعّالة. وقد قدم مؤخرًا نموذج PixelJev، وهو واجهة تعتمد على الصور تتيح اتخاذ قرارات مرتكزة على صورة معينة وتعليمات محددة، مما يُسهل الاختيار بين مجموعة من البدائل.
يعتمد PixelJev على نماذج متعددة الوسائط صغيرة مفتوحة، حيث يقوم بربط الصورة، وتعليمات المهمة، ومجموعة مرشحة من الخيارات بطرق منظمة، كما يُقيم دقة الاحتمالات المرتبطة بالمرشحين. هذا النموذج ليس مجرد ابتكار عابر، بل نتيجة لجهد علمي متكامل حاول دمج التعرف على الصور والإجابة على الأسئلة البصرية بطريقة متكاملة.
من خلال ثمانية اختبارات مرجعية، أظهر النموذج زيادة ملحوظة في دقة الاختيار، فقد ارتفعت دقة نموذج Pets من 60.13% إلى 92.40%. كما أن التحسينات لم تقتصر على الأداء على نماذج معينة بل شملت أيضًا مقاومة للتغيير في الأنماط الجديدة والملصقات. يُظهر هذا الاكتشاف نقطة انطلاق مهمة لنماذج اتخاذ القرار المرئية ذات الغرض العام، مع تحديد متطلبات أساسية منها متانة المخططات، والتحويل بين العائلات، والاستخدام الموثوق للأدلة المرئية.
الانتقال من النص إلى الصورة: نموذج اختيارات مرئي مبتكر يحدث ثورة في الذكاء الاصطناعي
يقدم البحث الجديد نموذج PixelJev الذي يُحدث تحولاً في كيفية اتخاذ القرارات المرئية من خلال واجهة تعتمد على صورة وتعليمات مهمة. يُظهر الأداء المذهل للنموذج في تحسين الدقة في مهام الإجابة على الأسئلة المرئية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
