في عالم الذكاء الاصطناعي، تُستخدم النماذج اللغوية الضخمة (Large Language Models) بشكل متزايد لتقييم الابتكار في الأبحاث العلمية خلال مراجعات الأقران في المؤتمرات الكبرى. إلا أن القدرة على تقييم الابتكار لا تزال نقطة ضعف بارزة، حيث تُقيم المعايير الحالية الابتكار كعوامل شاملة، مما يجعل من الصعب تحديد الأبعاد التي قد تسيء النماذج تقديرها.
تأتي نوف غوج (NovGauge) كحل مبتكر، حيث تُعتبر معيارًا إنسانيًا مدعومًا لتشخيص تقييم الابتكار. يتضمن هذا المعيار 619 زوجًا من الأبحاث و50 مجموعة متعددة، مستندة إلى مصادر مختصة تشمل مزاعم تداخل مراجعي ICLR واستطلاعات الاقتباس المتزامن. تم تصنيف الحالات بشكل مستقل عبر ثلاثة أبعاد: المهمة، المشكلة، والطريقة، مما يلتقط الأهداف التطبيقية والتحديات التقنية وسبل الحل.
تُقترح Pipeline تشخيصية تتكون من مراحل متعددة للتحقق من صحة الأبعاد، التحقق من المصادر، والدعم المنطقي. أظهرت تقييمات لـ 18 نموذجًا لغويًا معدل هالوكينج (hallucination rates) يتراوح من 0% إلى 39% عبر الأبعاد المختلفة. ومن بين الأحكام الإيجابية الصحيحة التي لم تتضمن هالوكينات، فإن أكثر من 70% من الأدلة لا تدعم السبب المذكور بشكل منطقي. يُظهر النموذج الأفضل أداءً، GPT-5.5، تحقيق معدل F1 موثق يتراوح بين 43-72% عبر الأبعاد، بينما تحتفظ معظم النماذج بأقل من نصف معدل F1 الخام بعد تحقق الصدقية. تشير هذه النتائج إلى أن النماذج اللغوية الحالية لا تزال بعيدة عن كونها موثوقة في تقييم الابتكار العلمي، خاصة عندما يتم ربط الصحة بالأدلة الموثوقة.
نوف غوج: معايير دقيقة لتشخيص قدرة النماذج اللغوية في تقييم ابتكار الأبحاث
تقدم نوف غوج معيارًا متقدمًا لتقييم مدى قدرة النماذج اللغوية على تقييم الابتكار في الأبحاث العلمية، مستندة إلى تقييمات متخصصة تسلط الضوء على نقاط الضعف. نتائج الدراسة تكشف عن نسبة عالية من الأخطاء لدى النماذج الحالية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
