في عالم الذكاء الاصطناعي، تُظهر النماذج اللغوية الضخمة (Large Language Models) قدرات قوية في التفكير المنظم ضمن سيناريوهات محددة وصغيرة. ومع ذلك، تبين أن هذه النماذج تواجه صعوبات كبيرة عند التعامل مع بيئات ضخمة ومتنوعة وديناميكية، حيث يتطلب الأمر تكامل الأدوات بسلاسة. للتغلب على هذا التحدي، تم تقديم ToolVerse كإطار شامل يُعين على توسيع بيئات التعلم الذاتي (Reinforcement Learning) للوكالات (agents) ويمكنها من القيام بمهام عملاقة تتطلب التفكير الطويل الأمد.
أولاً، يقوم ToolVerse بشكلٍ تلقائي ببناء بيئات تدريب تنفيذية ضخمة للوكالات، مستنداً إلى نحو 400 بروتوكول نموذجي (Model Context Protocols) يحتوي على حوالي 4500 أداة. ثانياً، نحن نقترح استراتيجية تصميم المهام تعتمد على رسم بياني لترابط الأدوات، مع استخدام خوارزمية أخذ العينات الديناميكية (Dynamic Unlocking Sampling Algorithm) لتوليد مهام طويلة الأمد، بالإضافة إلى إنتاج مجموعة بيانات GUST (Graph Unlocking Sampling Tasks). ثالثاً، للتخفيف من مشكلة تخصيص الائتمان في التعلم التعزيزي طويل الأمد، نقدم خوارزمية منحنية الوعي الدوراني والفوائد النسبية (Turn-Aware Relative Advantage).
من خلال إجراء تدريب موسع على وكالات تعلم التعزيز باستخدام ToolVerse، تم تقييم إطار العمل الجديد على عدة معايير للوكالات. تُظهر النتائج التجريبية أن ToolVerse يعزز بشكل كبير قدرات النماذج اللغوية الضخمة في استخدام الأدوات الطويلة الأمد، مما يؤدي إلى تحسن ملحوظ في الأداء وعرض تفكير مُحكم ضمن بيئات ديناميكية.
ToolVerse: فتح آفاق جديدة للتعلم التعزيزي في بيئات ضخمة ومهام طويلة الأمد!
أطلق الباحثون أداة مبتكرة تُعرف باسم ToolVerse، تهدف إلى تعزيز تعلم نماذج الذكاء الاصطناعي في بيئات واسعة ومعقدة. يوفر هذا الإطار الجديد إمكانيات جديدة للمستخدمين في التعامل مع مهام بذكاء اصطناعي أكثر فعالية ودقة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
