في عالم علم البيانات، تتطلب سير العمل الطويلة والممتدة تنسيقًا بين أدوات متعددة مثل دفاتر الملاحظات (notebooks)، البيئات التطويرية (IDEs)، المحطات الطرفية، المتصفحات، وقواعد البيانات. ومع ذلك، تفتقر المعايير الحالية إلى تقييم فعلي لتفاعل الأنظمة الآلية مع بيئات الحوسبة الحقيقية، مما يدفعنا للتساؤل: هل يمكن لهذه الأنظمة أن تنفذ سير العمل الكامل لعلم البيانات في البيئات الواقعية؟
تقدم DSAgentBench كمعيار جديد يهدف لتقييم قدرة الأنظمة الآلية على أتمتة سير العمل الكامل داخل بيئات الحوسبة الحقيقية. يحتوي هذا المعيار على 275 مهمة متنوعة تشمل جميع مراحل دورة حياة علم البيانات، مما يعكس التعقيد المطلوب وضرورة تنسيق الأدوات أثناء الممارسة.
تتطلب كل مهمة اتخاذ قرارات تعتمد على المخرجات الوسيطة واستخدام الأدوات بطريقة منسقة، حيث يتضمن المعيار مقيمًا حتميًا يتحقق من صحة التحليلات، والمخرجات البصرية، وأداء النماذج بدلاً من مجرد تنفيذ الكود.
تظهر التجارب الواسعة التي أجريناها على 15 نموذجًا مغلقًا ومفتوح المصدر أن أقوى نظام، وهو Claude-4.6-Sonnet، يحقق نجاحًا في المهام بنسبة 56.70% فقط، بينما تبقى جميع الأنظمة المفتوحة المصدر دون 1%، حيث تفشل في تنسيق الأدوات، والتكيف مع نظام التشغيل، والتفكير متعدد الخطوات. تكشف هذه النتائج عن فجوة كبيرة في القدرات بين الأنظمة الحالية ومتطلبات سير العمل في علم البيانات.
تعد DSAgentBench أساساً لتطوير وكلاء علم البيانات المستقلين والقابلين للتحقق، ويُعلن عن إطلاق المعيار عبر GitHub في الرابط التالي: https://github.com/vis-nlp/DSAgentBench. ما رأيكم في هذه التطورات في مجال علم البيانات؟ شاركونا آرائكم في التعليقات.
DSAgentBench: هل يمكن للأنظمة الآلية أتمتة سير العمل في علم البيانات بشكل كامل؟
تقدم DSAgentBench معيارًا جديدًا لتقييم قدرة الأنظمة الآلية على أتمتة سير العمل الكامل في علم البيانات داخل بيئات حوسبة حقيقية. تشير التجارب إلى فجوة كبيرة في القدرات بين الأنظمة الحالية ومتطلبات العمل الواقعي.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
