في عالم يتزايد فيه الاعتماد على الذكاء الاصطناعي (Artificial Intelligence)، تبرز أسئلة مهمة حول قدرة هذه الأدوات على منافسة خبراء المجال البشريين. توصلت دراسة جديدة إلى أن بعض نماذج اللغات الضخمة (Large Language Models) مثل GPT-5 وGPT-5 Nano قد حققت فعلاً نتائج متقاربة مع خبراء متخصصين في تقييم الأبحاث المتعلقة بالأورام الناجمة عن الكائنات الدقيقة.
تمت هذه الدراسة من خلال إشراك عدد من الخبراء لتطوير مجموعة بيانات تهدف إلى تقييم أداء نماذج الذكاء الاصطناعي. تناولت الدراسة 24 ورقة بحثية تتعلق بالعوامل الميكروبية وسرطان الثدي، مستخدمة نموذج مMTV-LV كحالة دراسية. تم إنشاء قالب منظم لاستخراج الأدلة وتقييمها، يتضمن أسئلة متعددة الاختيارات وقياس التصنيف، وكان عدد الأسئلة 77.
أظهرت النتائج أن نماذج GPT-5 وGPT-5 Nano كانت قادرة على الوصول إلى اتفاقات تشابه خبراء المجال في العديد من المجالات. وبالمقارنة، كانت نماذج Gemini 2.5 Pro وGemini 2.5 Flash أقل صرامة في تطبيق معايير الأورام. لكن، على الرغم من الأداء الجيد لنماذج GPT-5، إلا أن اللغط (Hallucinations) ظل نادرًا.
ومع ذلك، تبقى هناك نقاط ضعف مقلقة، إذ أن التقييم المنهجي لمحتوى الأبحاث وتحديد التناقضات كانت من بين الأوجه التي تحتاج إلى تحسينات إضافية. على الرغم من هذه التحديات، تدعم هذه الدراسة إمكانية استخدام نماذج الذكاء الاصطناعي في عمليات الاستخلاص المنهجي للأدلة بطريقة آلية.
لكن السؤال يبقى: هل ستكون هذه النماذج قادرة على تجاوز الخبراء البشريين بالكامل؟ ما رأيكم في هذا التطور؟ شاركونا في التعليقات.
ثورة الذكاء الاصطناعي: هل يمكن لنماذج لغوية تجاوز خبراء المجال في تقييم أبحاث السرطان؟
تكشف دراسة جديدة عن قدرة نماذج لغوية مثل GPT-5 على مطابقة أداء الخبراء في تقييم أبحاث السرطان المرتبطة بالعوامل الميكروبية. ولكن، هل ستكون هذه النماذج قادرة على تحسين تقييماتنا للأدلة العلمية بشكل مستدام؟
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
