في عالم الذكاء الاصطناعي، حققت نماذج اللغات الضخمة (Large Language Models) إنجازات مدهشة في تنفيذ المهام المعقدة باستخدام أدوات معينة. ومع ذلك، فإن التخطيط الطويل الأمد متعدد الخطوات يعد تحديًا كبيرًا، وذلك بسبب ارتفاع مساحة الاستكشاف وتفجير التركيبات. حتى عند العثور على مسار صحيح لاستخدام الأداة، عادةً ما يُعتبر هذا تكافؤًا فوريًا للتدريب الحالي، والذي لا يوفر معلومات قابلة لإعادة الاستخدام للتدريبات المستقبلية.
في هذا السياق، نعرض فكرة قوية: المسارات التاريخية الناجحة تحتوي على أنماط انتقال أدوات قابلة لإعادة الاستخدام، ويمكن الاستفادة منها خلال عملية التدريب بأكملها.
مستوحاة من خوارزميات تحسين مستعمرة النمل، حيث يمكن أن تُعكس المسارات الناجحة تاريخيًا من خلال الفيرومونات، نقدم نظام PhGPO (تحسين السياسة الموجهة بالفيرومونات). يقوم هذا النظام بتعلم نمط انتقال قائم على المسارات التاريخية (أي الفيرومون) من المسارات السابقة، ثم يستخدم الفيرومون المتعلم لتوجيه تحسين السياسات.
هذا الفيرومون المتعلم يوفر توجيهًا واضحًا وقابلًا لإعادة الاستخدام، مما يؤدي لتحسين التخطيط الطويل الأمد للأدوات بشكل ملحوظ. أظهرت النتائج التجريبية الشاملة فعالية PhGPO في تحقيق أهداف التخطيط المعقد.
تحسين التخطيط الطويل الأمد للأدوات: ثورة جديدة مع PhGPO!
تقدم تقنية PhGPO (تحسين السياسة الموجهة بالفيرومونات) حلاً مبتكرًا لتحديات التخطيط الطويل الأمد في استخدام الأدوات. هذه الطريقة تستفيد من الأنماط التاريخية الناجحة لتعزيز فعالية التوجيه خلال عمليات التدريب.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
