في عالم متسارع من الابتكارات في مجال الذكاء الاصطناعي، قدمت الأبحاث الأخيرة إطاراً مبتكراً يسمى Think with Structured Grounding (TwSG). هذا الإطار يهدف إلى تعزيز قدرة النماذج متعددة الوسائط على معالجة وتحليل الصور المعقدة، مثل الرسوم البيانية والجداول، من خلال تحسين دقة الفهم والاستدلال.
تعتمد العديد من النماذج اللغوية الكبيرة (MLLMs) على أدوات خارجية لتحقيق قدرات دقة إدراك متناهية، ولكن هذا يعتمد يؤدي غالباً إلى زيادة زمن الاستدلال ويعجز عن معالجة الفجوة الهيكلية الأساسية بين النصوص والعناصر المرئية. وللتغلب على هذه التحديات، تم تطوير TwSG لتمكين النماذج من التفكير بشكل أعمق مع الصور دون الحاجة إلى أدوات خارجية، مما يجعل العملية أسرع وأكثر كفاءة.
يعتمد TwSG على مبدأ جمع المعلومات وتوليدها باستخدام استراتيجيات متعددة الخطوات، حيث يتم توجيه نموذج تعليمي لتوليد بيانات إجابة مرئية (VQA) عالية الجودة. هذه البيانات تساعد على تحسين فهم النموذج لمعالجة العناصر المرئية الدقيقة، مما يقلل بشكل ملحوظ من زمن الاستدلال ويزيد من دقة الاستجابة. يشمل خط أنابيب التدريب الخاص بـ TwSG مرحلتين: الأولى تتعلق بالتدريب تحت إشراف بارد لتعزيز المهارات، والثانية تتعلق بتحسين التعلم من خلال آلية مكافأت جديدة تسمى TL-GRPO، والتي تدفع نحو التفكير الاستراتيجي.
تظهر التجارب المكثفة عبر نماذج متعددة أن TwSG لا يعزز فقط دقة الاستجابة بل يمنح النماذج القدرة على وصف المناطق الدقيقة واستراتيجيات التفكير المرن، مما يشكل نقلة نوعية في طريقة تفاعلنا مع البيانات المعقدة. هل أنتم مستعدون لاستكشاف هذا الابتكار الثوري في الذكاء الاصطناعي؟
إطلاق إطار Thinking with Structured Grounding: تعزيز الفهم المرئي باستخدام التعلم المعزز المدرك!
تم تقديم إطار Think with Structured Grounding (TwSG) لتحسين فهم النماذج متعددة الوسائط للصور. هذه التقنية الجديدة تساهم في تقليل زمن الاستدلال وزيادة دقة نماذج اللغة الكبيرة في معالجة الرسوم البيانية والجداول المرئية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
