تواجه الرعاية الصحية تحديًا كبيرًا عندما يتعلق الأمر بأخطاء تقارير الأشعة، والتي قد تؤثر سلبًا على علاج المرضى. في دراسة حديثة، تمت دراسة فعالية نماذج الذكاء الاصطناعي في اكتشاف هذه الأخطاء، مقارنين بين نماذج لغوية محددة المجال (domain-specific) والنماذج اللغوية الضخمة (Large Language Models - LLMs).

التحدي يكمن في أن الأخطاء في تقارير الأشعة غالبًا ما تكون دقيقة وتتطلب خبرة متخصصة لاكتشافها. ومن هنا، فقد تم تقييم أداء نماذج BERT الخاصة بالمجال مقارنةً مع نماذج LLMs مثل Qwen3-32B وGemma-3-27B وLlama-3.3-70B. تمت دراسة 30,633 تقريرًا لسرطان الأورام باستخدام بيانات تم جمعها من 23 أخصائي أشعة على مدار 10 سنوات.

أظهرت النتائج أن نموذجًا يحتوي على 15 مليون بارامتر حقق دقة توازن بلغت 94.4%، مع معدل إيجابيات خاطئة بلغ 5.8%، في حين أن النموذج الأقوى من LLMs حقق 84.0% فقط. كما تم تحسين أداء نموذج Llama-3.3-70B من خلال تعديلات محددة للمهام، ما يبرز أهمية التدريب الخاص بالمجال أكثر من حجم النموذج نفسه.

هذه النتائج تدعم استخدام النماذج المدمجة كنهج دقيق وفعال من حيث التكلفة في ضمان جودة تقارير الأشعة، مما يفتح المجال أمام تحسين معالجة البيانات الطبية.