في عالم الذكاء الاصطناعي، يعد التفكير بصور (images) أحد أساليب التفكير الحديثة التي تسمح للنماذج المتعددة الوسائط بالتعويض عن محدودية الإدراك. إلا أن الطريقة التقليدية المعروفة بتوجيه الإشراف (supervision) عبر المرحلتين: SFT (Supervised Fine-Tuning) ثم RL (Reinforcement Learning) قدسببت انحرافاً في التوجيه في كل مرحلة. وفي هذا السياق، تم تقديم نموذج ToolVision الجديد.

ToolVision يعتمد على استخدام أدوات بصرية (visual tools) في التعلم بطريقة فعالة تساعد النموذج على فهم كيفية توجيه واستخدام هذه الأدوات بشكل صحيح. ففي مرحلة SFT، يتم استكشاف مسارات الأداء من خلال أنبوب متعدد الوكلاء، حيث يقوم نموذج مع لجنة تشمل نماذج أصغر بتقييم مكاسب الأدلة بشكل تدريجي. هذه العملية تساعد في تصنيف المسارات والحفاظ على تلك التي تحقق النتائج الصحيحة فقط.

وعندما ينتقل النموذج إلى مرحلة RL، يقوم ToolVision بمقارنة أداء المتعلم مع وبدون استخدام الأدوات. ثم يتم مكافأة الاستخدام الناجح للأدوات فقط في المهام التي تقدم فيها الأدوات فائدة واضحة.

وليس من المستغرب أن ToolVision-8B قد تفوق على نماذج مثل Thyme-7B وCodeVision-8B وCodeDance-7B في جميع المقاييس الرئيسية السبعة، بالإضافة إلى الأداء الأفضل على High-Resolution benchmarks. من المقرر أن يتم إطلاق مجموعة البيانات (datasets) ورمز المصدر (source code) للجمهور قريبًا، مما سيعزز من عملية البحث والتطوير في هذا المجال.

ما رأيكم في هذا التطور المثير في الذكاء الاصطناعي؟ هل تعتقدون أن استخدام الأدوات البصرية سيغير طريقة تعلم النماذج؟ شاركونا آرائكم في التعليقات!