تتطور نماذج اللغات الضخمة (LLMs) بسرعة، لكنها لا تزال تعاني من نقص حاد في الربط بين درجات المؤشرات الفنية وفائدتها في العالم الحقيقي. يظهر التقييم الحالي نقصاً في التكامل، حيث يتم التركيز على مقاييس فنية مجزأة بعيداً عن الجوانب الشاملة والتطويرية والاجتماعية الضرورية عند نشر هذه النماذج. بدلاً من أن تكون مجرد دليل وصفي، تضع هذه الدراسة أُطُر تشخيصية تربط بين أبعاد التقييم وخط أنابيب تدريب نماذج اللغات الضخمة، مما يحول التقييم من ترتيب ثابت إلى أداة تشخيص تحليلية.
في هذه الورقة، نقدم إطار تقييم إنساني يُعيد تصور قدرات نماذج اللغات الضخمة عبر عدسة رباعية الأبعاد: معادلة الذكاء (IQ)، ومعادلة الاحتراف (PQ)، ومعادلة العاطفة (EQ)، ومعادلة القيمة (VQ). يتم تفعيل هذه المفاهيم من خلال هيكلية تقييمية نماذجية يتم التحقق من صحة ادعاءاتها التشخيصية من خلال تحليل ميتا لركائز المؤشر العام.
عبر تحليل أكثر من 200 مؤشر، نُجمع التحديات الرئيسية والاتجاهات المستقبلية. توفر هذه الدراسة دليلاً استراتيجياً لتطوير نماذج اللغات الضخمة تكون ليست فقط مركزة على الإتقان التقني ولكن أيضًا متوافقة مع القيم الأخلاقية والسياقات الاجتماعية. لمزيد من المعلومات، يمكنك زيارة المستودع المخصص المتوفر على: https://github.com/onejune2018/Awesome-LLM-Eval.
تقييم نماذج اللغات الضخمة: خارطة طريق مبتكرة نحو الفهم العميق
تقدم هذه الدراسة إطاراً تقييمياً مبتكراً لنماذج اللغات الضخمة (LLMs) يسعى لسد الفجوة بين نتائج المؤشرات الفنية واستخدامها في العالم الحقيقي. يتم التركيز على تطوير هذه النماذج وفق معايير شاملة تتضمن الذكاء العاطفي والأخلاقي.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
