في عالم متسارع التغيرات، يحتل البحث العلمي مكانة محورية في توسيع معارف البشرية. ومع ذلك، فإن عملية البحث تتطلب مهارات معقدة في استكشاف المعلومات والتفكير، تعكس تحديات كبيرة عند الاعتماد على الوكلاء المستقلين ونماذج اللغات الضخمة (Large Language Models).
أحدثت مجموعة من الباحثين ثورة في هذا المجال بإطلاق معيار 'سكي إكسبلور' (SciExplore)، والذي يهدف إلى تقييم قدرات المعلومات واستنباط الاستنتاجات العلمية من خلال مجموعة مكونة من أربع فئات من المهام. يتضمن المعيار 103 مهمة مُختارة بعناية تغطي أكثر من عشرة تخصصات علمية، تشمل:
1. استكشاف قواعد البيانات العلمية.
2. استرجاع الأدبيات المثيرة للالتباس.
3. إكمال المراجع المفقودة.
4. توليف المعرفة المنظم عبر مصادر متعددة.
يمثل هذا المعيار خطوة نحو تقييم حقيقي للقدرات، حيث ينظر في مستويات متقدمة من التفكير مثل الاستدلال على مستوى الكيانات، والتعرف على الوثائق، والعثور على الأدلة، وتوليف المعرفة على المستوى المعرفي.
عند تقييم أكثر من عشر نماذج متطورة، أظهرت النتائج وجود فوارق أداء ملحوظة، حيث تدهور الأداء بشكل حاد مع زيادة تعقيد المهام. كما أظهرت النماذج دقة منخفضة للغاية في مهام التوليف الهيكلي الأكثر تحديًا.
تشير النتائج إلى قيود هائلة تواجها النماذج الحالية وضرورة تحسينها لتلبية احتياجات البحث العلمي الفعلية. هذه المبادره تُعتبر دعوة للتفكير من جديد حول كيفية توظيف الذكاء الاصطناعي في مجالات البحوث العلمية، مما يتيح للعلماء توسيع معرفتهم بشكل أفضل.
سكي إكسبلور: تطور معايير تقييم الوكلاء المستقلين في البحث العلمي
تم إطلاق معيار جديد يُعرف بـ 'سكي إكسبلور' لدعم تقييم قدرات البحث العلمي باستخدام نماذج اللغات الضخمة، مما يكشف عن قيود كبيرة في النماذج الحالية. استعد لإعادة تعريف كيفية استكشاف المعلومات العلمية!
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
