في عالم الذكاء الاصطناعي، يعتبر دمج الرؤية مع اللغة خطوة رائدة نحو الفهم الأعمق للمحتوى العلمي. تعاني النماذج الذكية الحالية من صعوبة في تفسير الرسوم البيانية العلمية، التي تهدف إلى نقل معلومات وظيفية أو علاقات بدلاً من مشاهد واقعية بسيطة. لذلك، قدم الباحثون إطارًا مبتكرًا يُعرف باسم SciGram، الذي يُعزز قدرة النماذج على فهم الرسوم البيانية العلمية عن طريق خلق تعليمات مستندة إلى المصطلحات العلمية المعتمدة.

تتضمن العملية استخراج المفاهيم الأساسية في المجال العلمي، وتوليف حقائق بسيطة، واستخراج الرسوم البيانية ذات الصلة من الويب، وتوليد إشراف متعدد الوسائط يشمل تسميات الرسوم البيانية وأسئلة الاختيار من متعدد. بفضل هذه المنهجية، تم إنشاء مجموعة بيانات SciGram، والتي تضم أكثر من 194,000 رسم بياني و1.4 مليون تعليمات بصرية تغطي العلوم الحياتية، والأرضية، والفيزيائية.

وعلى الرغم من الاعتماد على بيانات مؤرشفة غير مثالية وتعليقات اصطناعية، إلا أن النماذج التي تم تدريبها على SciGram حققت تحسينات ملحوظة في معايير الأداء المرتبطة بالرسوم البيانية، مثل TQA وScienceQA وAI2D، حيث تفوقت أو حققت أداءً مشابهًا لأحدث نماذج VLMs المتاحة، وذلك مع عدد أقل من أوقات التدريب.

علاوة على ذلك، أثبت الجمع بين نماذج مثل LLaVA وOneVision مع SciGram أداءً غير مسبوق في إجابة الأسئلة عن الرسوم البيانية. تشير النتائج إلى فعالية توليد التعليمات المعتمدة على المصطلحات كاستراتيجية عامة لتحسين reasoning (الاستدلال) في المجالات العلمية. لدعم الأبحاث المستقبلية في فهم الرسوم البيانية العلمية، يُطلق الباحثون مجموعة بيانات SciGram ونماذجها.

هل تعتقد أن هذه الابتكارات ستغير طريقة فهمنا للمعلومات العلمية؟ شاركونا آراءكم في التعليقات!