في عالم الذكاء الاصطناعي (AI) المتطور، يأتي VAKRA كمبادرة جديدة تهدف لتقييم مهارات التفكير لدى الوكلاء في بيئات العمل بفعالية. يتضمن هذا المعيار أكثر من 8000 واجهة برمجة تطبيقات (APIs) قابلة للتنفيذ تمتد عبر 62 مجالًا مختلفًا، مما يوفر منصة شاملة لاختبار التفكير المعقد.
تتضمن المهام الموزعة عبر المعيار ثلاثة مستويات من الصعوبة المتزايدة، والتي تشمل: تفاعل أنماط API المتنوعة، والتفكير المتعدد الخطوات عبر واجهات برمجة التطبيقات المنظمة، وأخيرًا التفكير من مصادر متعددة مع قيود سياسات استخدام اللغة الطبيعية.
تم التحقق من صحة النتائج من خلال إعادة تنفيذ مكالمات الأدوات المتوقعة عبر واجهات برمجة التطبيقات الحية، مما يوفر تعدد المسارات الصحيحة.
استخدمت الدراسة نموذج ReAct الثابت لعزل قدرات النماذج عن بنية الوكلاء. وأظهرت النتائج أن أفضل نموذج لم يتجاوز أداء 70.4% في المهام البسيطة، حيث تدهورت النتائج بشكل ملحوظ لتصل إلى 50-51% في واجهات برمجة التطبيقات التركيبية. بالإضافة إلى ذلك، كان هناك انخفاض في الأداء بنسبة تزيد عن 50% كلما زادت عمق التفكير، مما يعكس أهمية هذه التحديات.
أخيرًا، يؤدي تحليل الأخطاء إلى تسليط الضوء على ضرورة تحسين جوانب التفكير المعتمد على اللغة، مثل فك الارتباط بين الكيانات والتوافق بين المصادر. يمكن الحصول على الشيفرة البرمجية الخاصة بـ VAKRA عبر GitHub بينما يتوفر مجموعة البيانات على Hugging Face.
ما هي آفاق هذا المعيار الجديد في تحسين قدرات الوكلاء الذكيين في الأعمال؟ شاركونا آرائكم في التعليقات!
VAKRA: ثورة في تقييم التفكير المعقد عبر واجهات برمجة التطبيقات (APIs) والسياسات
تم إطلاق VAKRA، معيار جديد يضم أكثر من 8000 واجهة برمجة تطبيقات قابلة للتنفيذ، لتقييم قدرة الوكلاء على التفكير المتعدد الخطوات. هذا المعيار يمثل خطوة مهمة نحو تحسين الأداء في بيئات الأعمال.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
