في عصر الذكاء الاصطناعي المتزايد، أصبحت نماذج اللغات الضخمة (Large Language Models) جزءًا حيويًا من حياتنا الرقمية. ومع توسع استخدامها، تنشأ الحاجة إلى وكلاء ذكيين يمكنهم التعامل مع مهام تتطلب مراقبة مستمرة أو إجراءات متكررة، مثل تحليل الأسواق.
وفي هذا الإطار، تم تقديم ReLiveGym، وهو بيئة تقييم تشخيصية تم تصميمها خصيصًا للاختبار الفعّال للوكلاء المدربين على المدى الطويل. يتيح هذا النظام للوكلاء العمل بشكل نادر على مدى أسابيع مع أحداث حقيقية تم إعادة تشغيلها، بما في ذلك أخبار السوق ووسائل التواصل الاجتماعي.
تستند هذه المهام إلى مستويات مختلفة من الحساسية الزمنية وشدة التفكير والتكرار، مما يوفر فرصة مثيرة لدراسة تأثير اختيار نموذج اللغة (language model) وتصميم الأداة (harness design) على أداء الوكلاء. أظهرت النتائج أن كيفية تحديد الوكلاء لتوقيت إجراءاتهم تلعب دورًا رئيسيًا في تصميم المهام طويلة الأجل، كما أن الأفضلية في التصميم تختلف حسب المهام ونوع النموذج المستخدم.
علاوة على ذلك، تم تقييم كيفية تأثير التعلم المستمر من ردود الفعل على الأداء وعلاج حالات الفشل التي تم ملاحظتها في هذه المهام. تكشف هذه النتائج أن اختيار النموذج، وآلية توقيت الإجراءات، واستخدام التعليقات تعتبر اعتبارات هامة عند تصميم الوكلاء المدربين على المدى الطويل.
استكشف معنا مجالًا جديدًا للرؤية حول الذكاء الاصطناعي وكيفية تصميمه لتعزيز الأداء ودقة العمل في بيئات معقدة ومتغيرة.
ReLiveGym: تقييم الوكلاء المدربين على المدى الطويل عبر أسابيع من الواقع المعادة!
أطلق الباحثون منصة ReLiveGym لتقييم أداء الوكلاء المدربين على المدى الطويل، حيث يتعاملون مع مهام قائمة على أحداث الحياة الواقعية. النتائج تشير إلى أهمية تصميم الوكلاء وتوقيت إجراءاتهم لتحقيق أفضل أداء.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
