في عصر يتسم بتصاعد الاستخدامات المعتمدة على الذكاء الاصطناعي، تنطلق دراسة جديدة لتتناول التحديات الراهنة في مجال الجاهزية البيانية للبيانات الجزيئية، وخصوصاً في جوانب التوصيف البياني للتجارب الحيوية. مع تزايد استخدام نماذج اللغات الضخمة (Large Language Models)، تبرز الحاجة إلى توضيح فعاليتها في تحسين دقة البيانات الوصفية.
تظهر النتائج التي توصل إليها الباحثون أن أنظمة البيانات العامة وقواعد بيانات الفحص الصناعي تعاني من نقص كبير في التوصيف الدقيق، حيث كشف تحليل لبيانات من قاعدة بيانات PubChem أن 36% من التجارب الحيوية تفتقر إلى تنسيقات معينة، و89% تفتقر إلى نوع محدد من التجارب، وأكثر من 99.9% من المصطلحات المرتبطة بالأساليب الكيميائية أو التقنيات.
لقد تم استخدام نماذج مفتوحة المصدر ونماذج ملكية في محاولة لتوقع هذه التوصيفات، ووجدت الدراسة أن قدرة هذه النماذج على تحقيق دقة عالية في أكثر من 96% من الحالات بالنسبة للأشكال الكيميائية الحيوية. وعلى الرغم من وجود بعض الحالات التي تنطوي على عدم توافق، فإن العديد من هذه التباينات تعود إلى اختلافات بين المصادر الموثوقة، وليس إلى أخطاء في النماذج نفسها.
علاوة على ذلك، أظهرت الدراسة من خلال تقييم نوعي مع خبير في هذا المجال أن الأدلة التي قدمتها نماذج اللغات الضخمة أدت إلى تعديل بعض التوصيفات الأصلية من قبل الخبير، مما يدل على إمكانية هذه النماذج في الكشف عن التجارب المحتمل أن تكون معلمة بشكل خاطئ. تجري هذه النتائج علامة إيجابية للقدرات المستقبلية لنماذج اللغات الضخمة في دعم وتحسين مدخلات الأنظمة الآلية الخاصة بتحليل البيانات في البيولوجيا.
في نهاية المطاف، بينما لا يزال من الضروري إجراء مراجعات مستهدفة من قبل البشر لضمان دقة التوصيفات، تبرز هذه الدراسة أهمية وأداء نماذج اللغات الضخمة في مجال البيولوجيا.
هل يمكن لنماذج اللغات الضخمة تحسين جاهزية البيانات في تحديد الخصائص الجزيئية؟
تسلط الدراسة الضوء على دور نماذج اللغات الضخمة في تحسين عملية التوصيف البياني للتجارب الحيوية، حيث تظهر النتائج ضرورة استحداث أدوات جديدة لتحسين دقة البيانات. يمكن لهذه النماذج دعم عمليتي التوصيف والتدقيق على نحو فعال.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
