في عصر تتسابق فيه نماذج اللغات الضخمة (Large Language Models) لتقديم معلومات موثوقة، يظل موضوع دقة الإحالات العلمية أحد التحديات الأساسية. في ظل ازدياد اعتماد الباحثين والطلاب على تلك الأدوات، أعلن العلماء مؤخراً عن تقديم معيار REASONS، الذي يهدف إلى تقييم دقة نسبة الإحالات العلمية في مجموعة متنوعة من السياقات.
يتضمن معيار REASONS، المكون من 12,723 حالة إحالة على مستوى الجمل، 12 فئة مختلفة من arXiv، مما يجعله مرجعاً قيماً لتقييم النظام في مواقف متنوعة. ولكن ما هو الجديد فعلاً؟ يتمثل الابتكار الرئيسي في استخدام إطار عمل مزدوج القياسات يشتمل على معدل الامتناع (Abstention Rate - AR) ومعدل الخداع (Hallucination Rate - HR) لتوصيف التوازن بين الموثوقية والاستجابة.
عند تقييم الأداء عبر أنظمة مختلفة، تم اكتشاف أن استخدام تقنيات استرداد مدعمة قد أسفر عن تحسين معدل الخداع ليصل إلى 65.4% مقارنة بـ 87.6% في أساليب بسيطة. ومع ذلك، وُجد أيضاً أن هذه الطرق قد تؤدي إلى انخفاض كبير في معدل الامتناع، مما يؤدي إلى تزايد المخاطر المرتبطة بمعلومات غير دقيقة.
عند التقييم من قبل البشر لمجموعات بيانات تتكون من 1,000 مخرج، تم العثور على تفاوت في نسبة الأخطاء الفعلية إلى الاقتباسات المقبولة، مما يسجل نسبة 12.7:1. وهذا يبرز ضرورة تقييم أنظمة نسبة الإحالات ليس فقط من حيث الدقة، بل أيضاً من قدرتها على الامتناع تحت ظروف عدم اليقين.
لم يكن قد سبق لمعيار REASONS أن قدم مرجعاً شاملاً لدراسة موثوقية الإحالة في إنشاء الاقتباسات، مما يجعله نقطة انطلاق جديدة من أجل تحسين أدوات الذكاء الاصطناعي للمساعدة في البحث العلمي.
ثورة في دقة الإحالة العلمية: تقديم معيار REASONS الجديد!
تقديم معيار REASONS الجديد الذي يضم أكثر من 12,000 حالة إحالة علمية، يكشف عن التحديات الكبيرة في الاعتماد على نماذج اللغة في تقديم معلومات دقيقة. اكتشف كيف يمكن أن يؤثر ذلك على الأبحاث العلمية في المستقبل.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
