دخلت نماذج اللغة الضخمة (LLMs) في صراع جديد لتحقيق التفوق في سوق الذكاء الاصطناعي، حيث أصبحت تعمل كعوامل مستقلة تستخدم أدوات خارجية عبر بروتوكول سياق النموذج (MCP). ومع ذلك، كانت معايير تقييم MCP الحالية تعاني من عدة نقاط ضعف، أبرزها الاعتماد على خدمات MCP الخارجية وافتقارها إلى الصعوبة المطلوبة في التقييم.

لمعالجة هذه المشكلات، تم اقتراح معيار MCPAgentBench، وهو معيار يعتمد على التعريفات الواقعية لـ MCP، بهدف تقييم قدرات استخدام الأدوات من قبل النموذجات. يحتوي MCPAgentBench على مجموعة بيانات تشمل مهام أصلية وأدوات MCP محاكية، مما يوفر تجربة واقعية أكثر دقة. وبفضل بيئة الرمل الديناميكية، يتم تقديم قوائم أدوات تضم خيارات غامضة، ما يتيح اختبار قدرات الاختيار والتمييز لدى النماذج.

بالإضافة إلى ذلك، يوفر MCPAgentBench مقاييس شاملة لقياس معدلات إتمام المهام وكفاءة التنفيذ. أظهرت التجارب التي أُجريت على نماذج اللغة الضخمة المتطورة فروقات ملحوظة في الأداء، خاصة عند التعامل مع استدعاءات أدوات معقدة ومتعددة الخطوات.

للحصول على الكود مفتوح المصدر الخاص بالتطبيق، يمكن زيارة الرابط. لا تفوت الفرصة لتكون جزءًا من هذا التطور في عالم الذكاء الاصطناعي! ما رأيكم في هذا الابتكار؟ شاركونا في التعليقات.