تعتبر أورام الرئة من الأسباب الرئيسية لوفيات السرطان على مستوى العالم، حيث يعد التصوير المقطعي المحوسب (CT) الأداة الأساسية للكشف والمتابعة. بعد اكتشاف العقد الرئوية، يقوم أطباء الأشعة بتقييم الموقع التشريحي، وقطر العقدة، وخصائص الحافة، ونوع التعتيم يدوياً لدعم تقييم المخاطر وصنع القرارات السريرية. ومع ذلك، فإن هذه العملية بعد الاكتشاف تستغرق وقتاً طويلاً وقد تتأثر بتباين المراقبين.

في هذا السياق، قُدم نموذج FZ-VLM، وهو إطار عمل يعتمد على نموذج اللغة البصرية (Vision Language Model) من نوعين: فلورنسا وزيفير. يهدف هذا النموذج إلى تقديم تقييم موحد لعقد الرئة في تصوير الأشعة المقطعية.

يعتمد الإطار على نموذج فلورنسا-2 المعدل لاستخراج الصفات الشعاعية من شرائح CT المحورية المرخمة من قبل الخبراء، بينما يستخدم نموذج زيفير-7B هذه الصفات لتوليد أوصاف للعقد، وتوصيات للمتابعة، وتحليلات طويلة الأمد.

أظهرت النتائج أن النموذج في المرحلة الأولى حقق دقة بنسبة 77.18% في تحديد الموقع التشريحي، و67.96% في خصائص الحافة، و79.13% في نوع التعتيم، مع خطأ مطلق متوسط قدره 2.58 مم في تقدير القطر، متفوقاً على نماذج GPT-4 الأخرى وكذلك المعيار البشري.

وعند تقيم المرحلة الثانية من النموذج، أظهرت نتائج تقدير أطباء الأشعة دقة تبلغ 93.9%، مع درجة كمال بلغت 98.6%، و76.1% من الأهمية السريرية، ودرجة إجمالية بلغت 89.5%.

على الرغم من أن التحليل للحفاظ على السلامة أظهر أن معظم النتائج كانت آمنة سريرياً، فقد تتطلب بعض توصيات المتابعة مراجعة من الخبراء. وبذلك، يمثل هذا البحث أول إطار عمل من نوعه يعتمد على نموذج اللغة البصرية ذا المرحلتين لتقييم العقد بشكل منظم وصنع القرارات السريرية.