في عالم الذكاء الاصطناعي، تكتسب الوكلاء المستقلون (Autonomous Agents) شهرة متزايدة لقدرتهم على إتمام ورش العمل المعقدة متعددة الأدوات في بيئات العمل الحقيقية. ومع ذلك، قد تميل المقاييس التقليدية لتقييم هذه الوكلاء إلى فصل المهام حسب التطبيق أو القدرات، وتقييمها في بيئات أكثر نظافة وثباتًا مقارنةً بتلك التي يواجهها المستخدمون في الواقع.
لذا، تم الإعلان عن DuMateBench، وهو معيار قامت بتطويره مجموعة من الباحثين، إذ يعتمد هذا المعيار على جلسات حقيقية متعددة تم جمعها من منصة نتاجية كبيرة، مع الحفاظ على الخصوصية. يتضمن DuMateBench 200 مهمة تمثل 8 سيناريوهات واسعة و17 فئة دقيقة من القدرات، حيث تتطلب معظم المهام تنسيقًا متعدد القدرات.
تتميز هذه المهام بتجهيزها في حاويات Docker مع إدخال ثلاث أشكال من التعقيد البيئي الواقعي: عدم كفاية، عدم استقرار، وضوضاء، مما يوفر إطار عمل شامل لتقييم الأداء باستخدام بروتوكول تقييم هجين يجمع بين التحليل الحاسم ونماذج اللغة الضخمة (LLM) كمقياس.
أظهرت التجارب عبر خمسة أطر تمثيلية للوكالات المستقلة، مقترنة بأربعة من أحدث نماذج اللغة الضخمة، وجود فجوات كبيرة في إتمام المهام بشكل صارم. كما أن التحليلات التكميلية حول المتانة والكفاءة والقدرة التشخيصية أظهرت أن الأداء تحت الاضطرابات البيئية يتشكل بشكل مشترك من خلال قدرات نموذج اللغة الضخمة وإطار العمل المحيط.
المثير أن الشيفرة والبيانات المتعلقة بـ DuMateBench متاحة للجمهور على الرابط DuMateBench. من المتوقع أن يسهم هذا المعيار في تعزيز فهمنا لقدرة الوكلاء المستقلين في العالم الحقيقي، مما يجعلها خطوة مهمة نحو تحسين الأداء في ظل ظروف العمل المتغيرة.
دومايت بينش: تقييم الوكلاء المستقلين في ورش العمل المعقدة الواقعية
تم إطلاق DuMateBench كمعيار جديد لتقييم أداء الوكلاء المستقلين في بيئات العمل الحقيقية. يتضمن هذا المنهج 200 مهمة تعرض مختلف التحديات من خلال محاكاة التداخلات البيئية الواقعية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
