في عالم الطب الحديث، تبرز نماذج الرؤية اللغوية الطبية (VLMs) كأداة قوية تتخطى الحواجز التقليدية في تشخيص الأمراض وفهم الصور السريرية. هذه النماذج ليست فقط قادرة على تقديم تشخيصات دقيقة، بل تقدم أيضاً تحليلات قابلة للتفسير. ومع ذلك، تظل هناك فجوة مهمة بين أداء موحدات الرؤية القوية والأداء الكامل للنموذج متعدد الوسائط.

أظهرت دراسة جديدة في مجال الأمراض الجلدية أن وحدة MedSigLIP تتفوق على وحدة MedGemma بفارق يصل إلى 10.26 نقاط مئوية، حتى بدون استخدام تسميات مستهدفة. ويدل ذلك على وجود تمثيلات بصرية قوية تستحق الدراسة. ولتسليط الضوء على هذه الفجوة، تم استخدام علم الأمراض الجلدية كنموذج اختبار رئيسي، حيث تم التحقيق في ثلاث فرضيات حول كيفية استخدام المعلومات البصرية في التشخيص ونوعية التنبؤات التي تفتقر في بعض الأحيان إلى الأساس المنطقي.

تم إجراء تحليل عميق لنمط الانتباه الداخلي للنموذج، حيث أظهرت النتائج أن استراتيجيات التوجيه البسيطة مثل "وصف ثم قرر" تزيد من نسبة انتباه الرؤية بنسبة تتراوح بين 30-40٪ أثناء عملية التوليد. في حين أن الضبط الدقيق المُخصص لتحسين تصنيف الأمراض الجلدية قد يُظهر أداءً محسنًا، إلا أنه قد يؤدي إلى تراجع أداء النموذج في الإجابة على الأسئلة الطبية متعددة المجالات.

لمعالجة هذه التحديات، تم دمج طرق التوجيه بدون تسميات مع إعادة تصنيف مساعدة من وحدات التشفير ذات التسميات القليلة مع الحفاظ على النموذج مجمدًا. وتمت المصادقة على هذه التدخلات عبر خمسة نماذج VLM في مجال الأمراض الجلدية، مع تقديم تحليلات تدعم التمثيلات وأنماط الانتباه عبر مجالات طبية إضافية.

هل أنتم مستعدون لاستكشاف المزيد حول كيفية تحسين نماذج الذكاء الاصطناعي في مجال الرعاية الصحية؟ شاركونا آراءكم في التعليقات!