في ظل الاستخدام المتزايد لنماذج اللغة الكبيرة (Large Language Models - LLMs) كمساعدين في التحليل الإحصائي وعلوم البيانات، تظل التقييمات الحالية تعتمد على فرضية أن هدف التحليل تم تحديده مسبقاً. لكن الواقع يختلف، حيث يأتي المستخدمون بأهداف غير رسمية وبيانات متنوعة، مما يتطلب من النموذج تقرير المهمة الإحصائية ذات الصلة والبيانات المناسبة لها.
ولمعالجة هذه الفجوة، قام الباحثون بترسيم هذه المرحلة الهامة في صياغة المشكلة الإحصائية (Statistical Problem Formulation) وتقسيمها إلى مهام فرعية: (1) تصنيف المشكلة الإحصائية و(2) تحديد المتغيرات وتوزيع الأدوار.
للتفاعل مع هذه الديناميكية الجديدة، تم تقديم منصة StatFormBench، وهي معيار تم تطويره باستخدام خمسة كتب دراسية في الإحصاء ومكتبة حالة للعلوم البيانات، مما يوفر مجموعة متنوعة من أنواع المشكلات، تمثيلات البيانات، وأنماط السيناريو. تتضمن هذه المنصة 1,013 عينة تغطي 20 فئة إحصائية حيوية و85 فئة فرعية دقيقة.
حتى الآن، فإن أفضل نماذج LLMs، عبر 14 نموذجًا مفتوحا ومغلقة، وصلت فقط إلى دقة تصنيف فرعية محدودة تصل إلى 72% وتداخل مجموعة المتغيرات بنسبة 63.2%. الأرقام تظهر أن لا نموذج يُظهر أداء ثابت الأفضل عبر المهام الفرعية، بينما استراتيجيات التحفيز المحسنة أنتجت مكاسب محدودة وغير متسقة.
كما تم توفير بيانات المعيار على منصة Hugging Face وكذلك الشيفرة لتقييمها على GitHub. هذا التطور يفتح آفاقًا جديدة للباحثين والممارسين لتحسين دقة نماذجهم واستخدامها بشكل أكثر فعالية في الأبحاث والدراسات.
هل أنتم مستعدون لتجربة الصياغة الجديدة للمشاكل الإحصائية؟ شاركونا آرائكم في التعليقات!
دعوة لاختبار نماذج اللغة: تحليل جديد لمشكلة صياغة الإحصائيات!
تقدم دراسة حديثة عن نماذج اللغة الكبيرة (LLMs) نموذجًا لتصنيف المهام الإحصائية ومكونات المعلومات ذات الصلة. تعرف على كيفية تحسين دقة هذه النماذج من خلال استخدام تجارب جديدة وصياغة قائمة على البيانات.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
