في عصر يتوسع فيه استخدام التعلم المعزز (Reinforcement Learning) كوسيلة فعالة لتحسين قدرات نماذج اللغة الكبيرة (Large Language Models - LLMs)، يأتي نظام StoreBench ليبرز كبيئة حيوية لتقييم وتدريب وكلاء التشغيل المستقل.
تعتبر جميع المعايير التقليدية لاختبار الأداء ثابتة، حيث يتم تحريك العالم فقط عندما يقوم الوكيل بفعل ما، ويكون الحكم النهائي على الأداء مبنيًا على نتائج جامدة. لكن مع StoreBench، يتفاعل الوكيل بشكل ديناميكي مع بيئة تجارة إلكترونية مخصصة، تعكس التعقيدات الحقيقية للسوق.
تقدم StoreBench لمحاكاة تشغيل متجر ملابس عبر الإنترنت، حيث يواجه الوكيل تحديات مثل تحركات العملاء على مدار الساعة، وتغيرات في أسعار الموردين، وصدمات في السوق تأتي أحيانًا بشكل مفاجئ. تتعدد الأدوات المتاحة للوكيل، حيث يملك 29 أداة تجارية يستخدمها مثل مشغل بشري، مما يمنح البيئة الواقعية المطلوبة لاختبار مهارات التخطيط والحكم الاقتصادي.
لقد اختبر الباحثون سبعة نماذج رائدة (frontier LLMs) عبر 11 سيناريو يمتد على فترات زمنية تتراوح بين 30 و45 يوماً، بالإضافة إلى محاكاة عام كامل. ورغم أن النتائج أظهرت تحسنًا ملحوظًا في أداء معظم النماذج على مدى العام، إلا أن وكيلًا بشريًا لا يزال يتفوق بشكل متوسط على جميع النماذج المدربة.
مع تطور هذا النظام وإطلاقه لمهام تدريبية نموذجية وأدوات للتحقق من الأداء، يبقى السؤال: هل ستكون StoreBench هي اللبنة الأساسية في بناء وكالات الذكاء الاصطناعي القادرة على المنافسة في الأسواق التجارية؟ لا تنسوا المشاركة بآرائكم حول هذا التطور المثير!
هل ستغير StoreBench مستقبل التدريب على الذكاء الاصطناعي في التجارة الإلكترونية؟ تعرف على البيئة المبتكرة!
أطلق الباحثون بيئة جديدة تدعى StoreBench، المصممة لتقييم وتدريب وكلاء التشغيل المستقل في مجال التجارة الإلكترونية. يوفر هذا النظام محاكاة حيوية للتجارة، تتيح لوكلاء الذكاء الاصطناعي مواجهة تحديات السوق الفعلية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
