في عالم الذكاء الاصطناعي، أصبحت وكالات نماذج اللغة تُستخدم بشكل متزايد من خلال حبال متعددة تختلف في أنماط النظام، مخططات الأدوات، دورات التحكم، وصيغ المسارات. ومع ذلك، تواجه هذه النماذج تحديات في الأداء المتفاوت بين هذه الحبال، مما يجعل تحقيق القوة والاستقرار عبر اختلافات الحبال هدفًا حيويًا.

وهنا يأتي دور HarnessBandit، وهو نظام جدولة مبتكر يركز على اختيار حبل واحد لكل خطوة من خطوات المحسن (Optimizer) بهدف تحسين أداء النماذج. بعد إجراء تحديث متعلق بسياسة تحسين جماعي (GRPO)، يقوم النظام بمراقبة قابلية التعلم - أي الفائدة المطلقة المتوسطة على الدفعة - وقابلية النقل، التي تعكس العلاقة بين متجهات التدرج الخاصة بالحبل الحالي والمتوسطات المتحركة لبقية الحبال.

تتم معالجة هذين الإشارتين بعد تطبيق تطبيع الحد الأدنى والحد الأقصى، ويتم أخذ العينات مع مكافأة تعتمد على الزيارة وأرضية استكشاف صريحة. من خلال تدريب نموذج Qwen3.5-2B عبر ستة حبال على منصة ClawGym، أظهر HarnessBandit تحسنًا ملحوظًا على كلا الاختبارين PinchBench وClawEval، فيما تشير التحليلات إلى أن قابلية التعلم وقابلية النقل توفر إشارات متباينة ومتطورة.

تتكشف هنا أمور مثيرة للاهتمام في مجال الذكاء الاصطناعي، حيث يقدم HarnessBandit نموذجًا مثيرًا للاهتمام لتطوير تقنيات التعلم العميق لتحسين أداء الأنظمة القائمة على الحبال. هل أنتم مستعدون لاكتشاف المزيد عن هذه التقنية الرائدة؟