شهدت نماذج الرؤية اللغوية الكبيرة (Large Vision Language Models) في السنوات الأخيرة قفزات هائلة في القدرة على تشخيص الأمراض. إلا أن استخدامها في المجال الطبي يواجه تحديات كبيرة، لا سيما في نقص المعرفة الخاصة بالمجال. في هذا السِياق، تم الكشف عن عمل بحثي جديد يحمل في طياته حلاً مبتكراً تحت مسمى "EyExIn"، يُعنى بمعالجة الثغرات التي تعيق الاستخدام الفعال لهذه النماذج في المجال الطبي.

النموذج الجديد يركز على سد ثغرتين رئيسيتين: أولاً، ثغرة الإدراك، حيث تفشل أنظمة التعرف العامة في الكشف عن العلامات المرضية الدقيقة مثل الأوعية الدموية الدقيقة. ثانياً، ثغرة التفكير، عندما تتغلب المعلومات النصية الضخمة على الأدلة البصرية المهمة في طبقات النماذج، مما يؤدي إلى استنتاجات غير دقيقة.

لمعالجة هذه التحديات، يعتمد الباحثون نهجاً ثنائياً ضمن بنية EyExIn، حيث يتم فصل التمثيل البصري إلى مجرى عام للمعلومات التشريحية ومجرى متخصص للمدلولات المرضية. هذا الفصل يعزز من قدرتها على دمج المعرفة الصحية الدقيقة ويتميز بتصميم يتيح تعزيز إشارة الأعراض الدقيقة مع تصفية أي ضجيج غير ذي صلة.

علاوة على ذلك، يقدم النموذج آلية جديدة تُعرف باسم "حقن الخبراء العميقة"، والتي تُدرج ميزات بصرية مدمجة كتحيزات في الطبقات المتوسطة، مما يضمن بقاء STACK التفكير مرتكزاً على الأدلة البصرية، مما يعزز من موثوقية التشخيصات.

أظهرت التجارب المستفيضة عبر أربعة معايير أن نموذج EyExIn يتجاوز الأنظمة الأخرى في الأداء، حيث يعزز بشكل ملحوظ إدماج المعرفة المتخصصة ويحقق دقة متقدمة في الإجابة على الأسئلة البصرية المتعلقة بعلم العيون. هذه الخطوة تمثل تقدماً كبيراً نحو تطوير ذكاء اصطناعي موثوق في القطاع الطبي.