في عالم الذكاء الاصطناعي، يظل تقييم الذكاء الاصطناعي الطبي (Medical AI) تحديًا رئيسيًا، حيث يُعتبر التقييم من قبل الأطباء المعتمدين المعيار الذهبي لقياس التفكير الإكلينيكي في نماذج اللغات الضخمة (Large Language Models). ومع ذلك، كانت الدراسات السابقة تعتمد على فرق من الأطباء في عدد محدود، مما كان يؤثر على النتائج العلمية ويقلل من إمكانية إعادة التجربة بأطقم مختلفة من المقيمين.

هنا، نُقدم لكم PrecepTron، نموذجًا متقدمًا تم تحسينه ليتناسب مع تقييم الأطباء لتجاوبات مفتوحة، مما يمكن من تقديم نتائج دقيقة وموثوقة. تم تدريب PrecepTron باستخدام تقنية التكيف منخفض الرتبة (Low-Rank Adaptation) على نموذج يحتوي على 32 مليار معلمة، وتم استخدام عدد قليل من الحالات الطبية من الأطباء كبيانات تدريب.

ولا يقتصر الابتكار على نموذج PrecepTron فقط، بل يتضمن إطلاق قاعدة البيانات الجديدة GRAND-ROUNDS، والتي تحتوي على 9,217 استجابة تم تقييمها من قبل 160 طبيبًا، ما يسهم في تعزيز الدراسات السريرية بشكل كبير.

تشير نتائجنا إلى أن النماذج المتطورة من نماذج اللغات الكبيرة، في المناهج المعتادة، غالبًا ما تتعارض مع الآراء الطبية التقليدية، لكن بعد تحسين PrecepTron، يمكن تحقيق توازن وتناسق في الدرجات عبر مختلف المهام.

نستعرض أيضًا كيف يمكن أن يفتح PrecepTron أبوابًا جديدة للأسئلة حول كيفية تفكير نماذج الذكاء الاصطناعي في ممارسات الطب، بما في ذلك قياس دقة التشخيص عند تقديم الحالات السريرية بشكل غير مكتمل. إذًا، مع PrecepTron وGRAND-ROUNDS، نبني أساسًا لدراسة شاملة وقابلة للتكرار حول كيفية تفكير نماذج الذكاء الاصطناعي في الرعاية الصحية. إن جميع الأكواد والبيانات والعلامات متاحة مجانًا للباحثين، مما يساهم في تعزيز التعاون العلمي في هذا المجال.