في عالم البحث العلمي، تعتبر الرسوم البيانية أحد أبرز أشكال التواصل المرئي. ومع ذلك، فإن النماذج اللغوية الكبيرة (MLLMs) غالبًا ما تترجم محتويات هذه الرسوم إلى نصوص، مما يجعل من الصعب على القارئ ربط الشرح بالرسوم الموجودة. هنا يأتي دور FigAct، إطار العمل الذي يغير اللعبة.

يعمل FigAct على إعادة تشكيل الرسوم البيانية العلمية لتصبح تجارب مرئية مشروطة بأسئلة، من خلال التفاعل مباشرة مع العناصر الرسومية القائمة. كما يفعل المتحدث البشري، يقوم FigAct بإنشاء سلسلة من السرد القصير، ويؤسس كل سرد على الأدلة المرئية ذات الصلة، ويطبق إجراءات بصرية لتوجيه انتباه المشاهد.

تم تطوير استراتيجية بحث هرمية لزيادة كفاءة تحديد الموقع للعناصر، مما يقلل من استخدام الرموز بحوالي 40 مرة. علاوة على ذلك، تم تدريب نموذج FigAct-8B باستخدام ثلاثة مكافآت خاصة بالمهام لتحسين دقة التأسيس وكفاءة البحث وجودة العرض.

لضمان فعالية هذه الطريقة، أنشأنا معيارًا يتم التحقق منه بشريًا من الرسوم في الأوراق العلمية الحقيقية، وذلك لتقييم قدرة النماذج اللغوية الكبيرة على إنتاج شروحات بصرية موجهة. أظهرت نتائجنا أن FigAct يحقق نجاحًا في جعل الرسوم البيانية العلمية كـ "لوحات تقديم"، مما يسهل الفهم والتنقل عبر المعلومات المعقدة بشكل واضح وسلس.

في عصر يتزايد فيه الاعتماد على التواصل المرئي، تمثل ابتكارات مثل FigAct خطوة استراتيجية نحو تحسين كيفية تقديم المعلومات العلمية، ومعالجة التحديات التي تواجه الباحثين والمتعلمين. ما رأيكم في هذا التطور؟ شاركونا في التعليقات.