تتوقف فعالية أداء الوكلاء على عوامل متعددة، أبرزها المعلمات النموذجية وكود الهيكل القابل للتنفيذ الذي يدير السياق وتدفق التحكم. وغالبًا ما يؤدي تحسين أي من هذه المكونات بشكل منفصل إلى وجود عنق زجاجة يؤثر سلبًا على النظام ككل. في هذا السياق، تتنافس تقنيات التكيف المشترك الموجودة على تحسين الأوزان والنصوص، لكن تترك هيكل النظام مثاليًا.
لذا نُقدم WHALE (Weight-Harness Alternating LEarning)، وهو أسلوب مبتكر يقوم على التبديل بين مرحلتين: أولاً، تحديث النموذج وفقًا للهيكل الحالي، وثانياً، البحث عن هيكل أفضل بناءً على النموذج المحدّث. يتم تنفيذ هاتين المرحلتين من خلال تحسين توقيع القبول المرفوض عبر الإنترنت وMeta-Harness.
تحديد متى يجب التبديل بين المرحلتين هو خيار تصميم رئيسي. باستخدام WHALE، يمكن الفصل بين التحسينات الحقيقية والضوضاء دون الإفراط في تحسين المكون المتغير. يمكن أن يتم التبديل عبر فترات ثابتة أو قاعدة صبر متناسبة مع إشارات التدريب.
عند تطبيق WHALE على وكلاء Qwen3.5-2B/4B، انطلقت النتائج عبر ثلاثة مجالات: الإجابة على الأسئلة، والتفكير الرياضي، وحل الألغاز الشطرنجية، متفوقة على تقنيات تحسين الوزن فقط أو الهيكل فقط، حيث حققت تحسنًا قدره من 4.15 إلى 24.38 نقطة مئوية في الدقة المتوسطة.
لاحظت الدراسة أيضًا أن أي من المكونات يمكن أن يكون عنق الزجاجة. على سبيل المثال، يطابق البحث عن الهيكل أقصى دقة للتحسينات التي تعتمد على الوزن مع عدد أقل بكثير من العمليات في SearchQA، لكنه يحسن الدقة الرياضية فقط بعد تحديث الوزن. بل إن التحديثات الصغيرة المتداخلة تفوق تحسين الوزن ثم الهيكل في الدقة وتكلفة العمليات.
يمكنكم الاطلاع على الشيفرة المصدرية وتفاصيل إضافية عبر الرابط: https://github.com/krafton-ai/WHALE.
WHALE: استراتيجية مبتكرة لتحسين الأداء من خلال تحسين الوزن والهيكل المشترك
تقدم WHALE أسلوبًا مبتكرًا لتحسين أداء الوكلاء من خلال التبديل بين تحديث الوزن والهيكل، مما يزيد من الفعالية والدقة. يجمع هذا النهج بين أساليب جديدة لتحسين التدريب والتفاعل بين المكونات.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
