في عالم الطب الحديث، تمثل نماذج اللغة الكبيرة (Large Language Models) ثورة فعلية في تفسير الصور الطبية. لكن، تبقى هذه النماذج تعاني من بعض القيود الأساسية مثل تضليل المعلومات (hallucination) والدقة المحدودة، بالإضافة إلى تقلب النتائج من تجربة لأخرى. من هنا، تم تطوير وإثبات فعالية إطار ذكاء اصطناعي أكثر ذكاء يقوم بدمج نماذج اللغة الكبيرة مع أدوات التعلم العميق المتخصصة لكشف الزرق (glaucoma) من تصوير قاع العين.

تتضمن عملية العمل ثلاث خطوات رئيسية: 1) تقييم أولي باستخدام نماذج اللغة؛ 2) استدعاء الوظائف لتنشيط الأدوات المتخصصة لتقييم جودة الصورة (QAModel، FundaQ-8)، وتصنيف الزرق (SwinV2-Tiny)، وتقسيم القرص/الكأس البصري (SegFormer-B0)؛ و3) تأمل نماذج اللغة التي تدمج الانطباعات الأولية مع مخرجات الأدوات.

تم تقييم نموذجين من نماذج اللغة (Gemini 2.5 Flash وGPT-5.4 mini) على مجموعتين من البيانات العامة مما أظهر نتائج مذهلة. حيث تحسنت دقة التصنيف بمعدل يتراوح بين 16 إلى 47 نقطة مئوية، وصولًا إلى تقارب الدقة المتخصص بنسبة 88% في أفضل السيناريوهات، مع انخفاض ملحوظ في نسبة الخطأ بنسبة 15-50% لنسبة القرص إلى الكأس.

بنظرة مستقبلية، تشير النتائج إلى إمكانية دمج نماذج اللغة الكبيرة مع أدوات متخصصة لتجاوز القيود السابقة، مما قد يفتح الطريق نحو أنظمة طبية تعتمد على تنسيق أنظمة متعددة بدلاً من نماذج أحادية.

إذا كنت مهتمًا بما يمثله هذا الاستكشاف الجديد لمستقبل تطبيقات الذكاء الاصطناعي في مجال الطب، فنحن ندعوك لمشاركة آرائك وملاحظاتك في التعليقات أدناه!