تسعى الأبحاث الحديثة في الذكاء الاصطناعي (AI) إلى تحسين الفهم والدقة عند استخدام نماذج اللغة الكبيرة (LLMs) لدعم القرارات العلمية. تأتي التحديات من صعوبة تقدير مستوى الثقة في النتائج المستخرجة من هذه الأنظمة، خصوصاً في الصفوف التصنيفية الهرمية.

تتناول دراسة حديثة نشرت على منصة arXiv، الأساليب الجديدة لتقدير عدم اليقين في قرارات التصنيف المستندة إلى البيانات البيولوجية بواسطة نماذج LLMs. يستند هذا البحث إلى استخدام ميزات وكالة مفتوحة المصدر (open-source tool) لتدريب مُقدرات خفيفة الوزن مع إشراف مدرك للهرمية، مما يُمكّن من قياس الدقة التصنيفية بطريقة أكثر فعالية.

فقد أظهرت النتائج أن هذه المُقدرات تتفوق بشكل ملحوظ على الأساليب التقليدية، حيث ارتفعت نسبة الـ AUROC من 0.57 إلى ما بين 0.75 و0.80. تم تحقيق أفضل النتائج باستخدام تصميم مُحدد للرتبة (H3) يراعي الهيكل الهرمي في المخرجات، مما يؤكد أهمية مراعاة الديناميكيات الهيكلية عند اعتماد قاعدة موحدة للاستغناء عن بعض التوقعات.

يمكن للباحثين الوصول إلى الشيفرة المصدرية لهذه الدراسة عبر الرابط: [https://github.com/uoguelph-mlrg/hierarchy-aware-llm-uq]. ما رأيكم في هذا التطور؟ شاركونا في التعليقات.