في عالم الذكاء الاصطناعي، يبقى تطوير الصور العلمية بدقة عالية تحديًا كبيرًا لم يُحل بعد. تتناول الأبحاث الجديدة هذا التحدي، حيث تُظهر أن البيانات الاصطناعية قد حسنت من reasoning العلمي في المجال النصي، لكنه في المقابل لا يزال هناك عقبة في معالجة الصور العلمية بدقة.

تُعاني نماذج تحويل النص إلى صورة (Text-to-Image T2I) من إنتاج مخرجات قد تبدو جذابة بصريًا لكنها تفتقر إلى الدقة العلمية، مما يخلق فجوة بين المنطق واللغة المرئية. في ضوء التقدمات التكنولوجية الحديثة في نماذج T2I، أُجري تحليل منهجي حول توليد الصور العلمية، حيث تم استخدام منهجيات تقييم متعددة.

عُرضت أداة جديدة تُسمى ImgCoder، والتي تعتمد على إطار عمل مدفوع بالمنطق، يتبع خطوة "فهم - تخطيط - برمجة" لتعزيز الدقة الهيكلية. لجعل التقييم صارمًا، تم تقديم SciGenBench، التي تقيم الصور المولدة بناءً على فائدة المعلومات وصلاحيتها المنطقية.

توصلت نتائج التقييم إلى وجود أنماط فشل منهجية في النماذج المعتمدة على البكسل، وأبرزت العلاقة المتبادل بين قُدرة التعبير والدقة. الأهم من ذلك، أظهر البحث أن تعديل النماذج متعددة الوسائط الكبيرة (Large Multimodal Models LMMs) بناءً على صور علمية مُصنّعة بدقة عالية يؤدي إلى تحسنات ملحوظة في reasoning، مما يوفر مسارًا جديدًا للتقدم في هذا المجال.