تسارع التطور في أنظمة الوكلاء المتعددين (Multi-Agent Systems) المعتمدة على نماذج اللغات الضخمة (Large Language Models) ، وقد أفرز هذا التوسع حاجة ملحة لنموذج موحد يسمح بتقييم هذه الأنظمة بشكل فعال. إن التحدي يكمن في أن التتبع المتغاير لأداء هذه الأنظمة توفر معلومات غير كافية للمقارنة الموضوعية بينها.

بينما تقتصر المقاييس التقليدية على النتائج النهائية فقط، تُظهر الحاجة إلى تقييم أكثر تفصيلاً يأخذ بعين الاعتبار عمليات التعاون بين الوكلاء. وهذا ما جعل فريق البحث يقدم إطار "فورست بنش". هذا الإطار المبتكر يقوم بربط التتبع الأصلي للأنظمة ضمن فضاء مشترك لرسوم التعاون الموحدة، مما يمكّن من تقييم أساليب متنوعة تحت نفس المعايير والمقاييس.

تضمن الأغصان المرجعية المدمجة ضمن "فورست بنش" مجموعة من الرسوم المثبتة التي تسجل طرق التعاون المختلفة، بدلاً من افتراض عملية مثلى واحدة. ومن خلال استخدام هذا الإطار، تم تحليل 844 استفسارًا تتطلب التعاون من سبع مجموعات بيانات عامة، وتم حساب عشرة رسومات مرجعية ناجحة لكل استفسار، مما ساهم في اختبار ستة أطر عمل تمثيلية لأنظمة الوكلاء المتعددين.

بالإضافة إلى ذلك، يُظهر البحث مدى استقرار وكفاءة عملية التقييم، حيث يتم قياس الأداء في غضون milliseconds، مما يوفر أسس هيكلية قابلة لإعادة الاستخدام لمقارنة مختلف تتبعات التعاون.

فورست بنش يمثل خطوة هامة نحو تحسين تقييم الأنظمة المعقدة وتوسيع إمكانيات البحث في مجالات الذكاء الاصطناعي. ما رأيكم في هذا التطور؟ شاركونا في التعليقات.