في عصر الذكاء الاصطناعي المتزايد، أصبحت نماذج اللغات الضخمة (Large Language Models) جزءًا حيويًا من حياتنا الرقمية. ومع توسع استخدامها، تنشأ الحاجة إلى وكلاء ذكيين يمكنهم التعامل مع مهام تتطلب مراقبة مستمرة أو إجراءات متكررة، مثل تحليل الأسواق.

وفي هذا الإطار، تم تقديم ReLiveGym، وهو بيئة تقييم تشخيصية تم تصميمها خصيصًا للاختبار الفعّال للوكلاء المدربين على المدى الطويل. يتيح هذا النظام للوكلاء العمل بشكل نادر على مدى أسابيع مع أحداث حقيقية تم إعادة تشغيلها، بما في ذلك أخبار السوق ووسائل التواصل الاجتماعي.

تستند هذه المهام إلى مستويات مختلفة من الحساسية الزمنية وشدة التفكير والتكرار، مما يوفر فرصة مثيرة لدراسة تأثير اختيار نموذج اللغة (language model) وتصميم الأداة (harness design) على أداء الوكلاء. أظهرت النتائج أن كيفية تحديد الوكلاء لتوقيت إجراءاتهم تلعب دورًا رئيسيًا في تصميم المهام طويلة الأجل، كما أن الأفضلية في التصميم تختلف حسب المهام ونوع النموذج المستخدم.

علاوة على ذلك، تم تقييم كيفية تأثير التعلم المستمر من ردود الفعل على الأداء وعلاج حالات الفشل التي تم ملاحظتها في هذه المهام. تكشف هذه النتائج أن اختيار النموذج، وآلية توقيت الإجراءات، واستخدام التعليقات تعتبر اعتبارات هامة عند تصميم الوكلاء المدربين على المدى الطويل.

استكشف معنا مجالًا جديدًا للرؤية حول الذكاء الاصطناعي وكيفية تصميمه لتعزيز الأداء ودقة العمل في بيئات معقدة ومتغيرة.