في عالم الذكاء الاصطناعي، أصبحت الذاكرة الطويلة الأمد مكونًا أساسيًا في أنظمة نماذج اللغات الضخمة (Large Language Models). لكن معظم المقاييس الحالية تركز فقط على تقييم المحادثات أو الملخصات الموجزة، مما يعيق قدرة هذه الأنظمة على استرجاع المعلومات من الأوراق العلمية بالكامل.
حديثنا اليوم عن مقاييس جديدة في هذا السياق، حيث قدم الباحثون معيارين جديدين للذاكرة العلمية: ذاكرة الذكاء الاصطناعي العامة (Public AI Memory - PAIM) وذاكرة المحولات العامة (Public Transformers - PTr).
تتضمن ذاكرة PAIM 81 ورقة بحثية و66 سؤالاً، بينما تحتوي PTr على 252 ورقة بحثية و98 سؤالاً. تم تقييم ثمانية أنظمة مختلفة لاسترجاع الذاكرة، بما في ذلك النظام المقترح الجديد "ثيورا"، ليظهر التحليل أن قوائم الذاكرة لا يمكن تفسيرها بدون بعد كامل.
أشارت النتائج التي توصلوا إليها إلى أن العوامل مثل دقة الاسترجاع وميزانية الاسترجاع تلعب دورًا حاسمًا في النتائج. في PAIM، فاز نظام Graphiti بعدد كبير من النقط ولكنه استخدم 2.6 مليون حرف من السياق المسترجع لكل استفسار، وعند التحكم في ميزانية الاسترجاع، تلاشت هذه الصدارة.
وعلى PTr، حيث يمكن إضافة أسلوب استرجاع BM25 بشكل نظيف، كان التباين الهجين بين تقنيات Sparse وDense هو التدخل الأكثر أهمية. وقد أظهر تقييم متعدد المحكمين توافقًا بين تقييم نماذج الذكاء الاصطناعي وتجارب البشر، مع قابلية قياس متناسقة.
هذه النتائج تدفع الباحثين إلى التأكيد على أن تقييم الذاكرة العلمية يجب أن يتم كعملية مدروسة وواعية للنوع، بدلاً من كونها مجرد قائمة بأفضل النماذج. حيث تم إصدار بيانات هذه الدراسة، مع التعليمات البرمجية اللازمة لإعادة إنتاج النتائج، بغرض توسيع هذا المجال الواعد.
يمكنك العثور على الكود على http://gitlab.com/quantellence/research/scientific-recall-bench والبيانات على http://huggingface.co/datasets/quantellence/srb-data.
ما رأيكم في هذا التطور الثوري في تقييم الذاكرة العلمية؟ شاركونا أفكاركم في التعليقات!
خطوة ثورية في تقييم الذاكرة العلمية: كيفية استعادة المعلومات بشكل مدروس!
يقدم الباحثون مقاييس جديدة تقيم ذاكرة الذكاء الاصطناعي في استعادة معلومات من الأوراق العلمية بشكل أكثر دقة. تعرف على الإنجازات الجديدة في هذا المجال!
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
