أصبح الذكاء الاصطناعي (AI) جزءًا لا يتجزأ من مجالات عدة، ولكن بالحديث عن نماذج اللغة، لم يكن هناك طريقة فعالة لتقييم أدائها في المهام ذات القيمة الاقتصادية. هنا تدخل EconEvals، وهي أداة تقييم مفتوحة المصدر تهدف إلى قياس قدرات نماذج اللغة في سياق الأنشطة الوظيفية والمهام التي يقوم بها العمال في الاقتصاد الأمريكي.
تعتمد هذه الأداة على استفسارات حقيقية من المستخدمين، مما يزيد من دقة التقييم، وهي تشمل بيانات اصطناعية لتعزيز التحليل. والأكثر إثارة أن تقييمات EconEvals تغطي نطاقًا أوسع بكثير مقارنة بمؤشر GDPval الحالي من OpenAI، حيث تغطي 5% فقط من المهن الأمريكية ولكن بتكلفة أقل بـ 500 مرة.
تتضمن هذه الدراسة أداة جديدة تعتمد على محاكاة لتقدير الوقت الذي يمكن أن توفره نماذج اللغة لمستخدميها عبر جميع المهام الوظيفية. وتشير التقديرات إلى أن النماذج الحالية يمكن أن توفر للعمال وقتًا كبيرًا في ما لا يقل عن نصف المهام في 47% من المهن.
ومع ذلك، يبرز انزعاج من نتائج مثيرة، حيث أن 79% من المهام التي تم التنبؤ بتوفيرها للوقت، لم تظهر استخدامًا مرتفعًا لنموذج Claude، مما يشير إلى أن الاستخدام الحالي لا يزال بعيدًا عن الإمكانيات الممكنة.
تسليط الضوء على هذه النقاط يساعدنا على فهم التحديات التي تواجه نماذج اللغة، مثل قيود الخصوصية والأنظمة المحمية التي تشكل عقبات رئيسية أمام تحقيق وفورات الوقت المحتملة. في المجمل، تقدم هذه الدراسة بنية تحتية قابلة للتكيف تهدف إلى فهم تأثير نماذج اللغة في سوق العمل بناءً على قدراتها الحالية، ويتم تحديثها باستمرار مع تطور تلك القدرات.
كيف يمكن لنماذج اللغة تحسين الاقتصاد؟ اكتشافات جديدة مثيرة!
في دراسة جديدة، قدّمت EconEvals طريقة مبتكرة لتقييم أداء نماذج اللغة في المهام الاقتصادية. تشير النتائج إلى أن هذه النماذج قد تساعد في توفير وقت كبير للعمال، ولكن الاستخدام الحالي لا يزال متدنيًا.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
