يُعد نظام WAR (Workload-Aware Rollouts) نقطة تحول جديدة في عالم التعلم المعزز (Reinforcement Learning) حيث ساهم في تسريع عملية الانطلاق المتزامن لبروتوكولات التعلم. تعد هذه العملية من أكثر العمليات محدودية للنظم المستخدمة في هذا المجال، حيث تنمو المسارات بشكل سريع لتصل إلى عشرات الآلاف من الرموز، مما يعيق تدريب الوكلاء في بيئات معقدة.
يتسم نظام WAR بتحسين مزدوج يجمع بين تقنيات فك التشفير والجدولة لتحقيق أفضل أداء. هذا النظام يعتمد على ملاحظة رئيسية مفادها أن الاستراتيجية المثلى لتحسين الانطلاق تعتمد على الحمل في الوقت الحقيقي. عند انخفاض الحمل، يسمح WAR بفك تشفير غير معتمد على النموذج باستخدام تقنية SuffixDecoding، التي تعيد استخدام أنماط النهاية من المسارات السابقة كمسودات مستقبلية، وبالتالي تتجنب أي ضغط إضافي على وحدات معالجة الرسوم GPU.
أما في حال زيادة الحمل، فيعتبر WAR فعالًا من خلال التركيز على جدولة الذاكرة الفعالة، حيث يُعين جدولة عالمية لأماكن الطلب عبر النسخ الخاصة بالانطلاق بناءً على توطين الذاكرة المحسنة، والتقدم في المسار، وحمل الخادم، مما يخفض الحاجة لتكرار حساب ذاكرة KV.
قد نجح نظام WAR في تحسين أداء انطلاق الوكلاء في البيئات ذات السياق الطويل بنسبة تصل إلى 1.4 مرة تحت الحمل المنخفض و1.6 مرة في ظل الحمل العالي. تُظهر هذه النتائج أهمية WAR في إزالة العوائق الكبيرة للانطلاق في التعلم المعزز، مما يفتح آفاقًا جديدة لتدريب الوكلاء في البيئات المتقدمة والمعقدة.
اكتشف WAR: النظام الثوري لتعزيز التعلم المعزز من خلال تسريع انطلاق الوكلاء!
تقديم نظام WAR الذي يسرع عملية الانطلاق في التعلم المعزز ويحل bottleneckات الأداء بفاعلية كبيرة. تعرف على كيفية تحسين WAR لسرعة الانطلاق في البيئات ذات السياق الطويل.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
