في عالم الذكاء الاصطناعي المتسارع، تبرز الحاجة إلى نماذج قادرة على اتخاذ قرارات مرئية فعّالة. وقد قدم مؤخرًا نموذج PixelJev، وهو واجهة تعتمد على الصور تتيح اتخاذ قرارات مرتكزة على صورة معينة وتعليمات محددة، مما يُسهل الاختيار بين مجموعة من البدائل.

يعتمد PixelJev على نماذج متعددة الوسائط صغيرة مفتوحة، حيث يقوم بربط الصورة، وتعليمات المهمة، ومجموعة مرشحة من الخيارات بطرق منظمة، كما يُقيم دقة الاحتمالات المرتبطة بالمرشحين. هذا النموذج ليس مجرد ابتكار عابر، بل نتيجة لجهد علمي متكامل حاول دمج التعرف على الصور والإجابة على الأسئلة البصرية بطريقة متكاملة.

من خلال ثمانية اختبارات مرجعية، أظهر النموذج زيادة ملحوظة في دقة الاختيار، فقد ارتفعت دقة نموذج Pets من 60.13% إلى 92.40%. كما أن التحسينات لم تقتصر على الأداء على نماذج معينة بل شملت أيضًا مقاومة للتغيير في الأنماط الجديدة والملصقات. يُظهر هذا الاكتشاف نقطة انطلاق مهمة لنماذج اتخاذ القرار المرئية ذات الغرض العام، مع تحديد متطلبات أساسية منها متانة المخططات، والتحويل بين العائلات، والاستخدام الموثوق للأدلة المرئية.