في عالم الذكاء الاصطناعي، تواصل النماذج اللغوية الضخمة (Large Language Models) تطورها السريع وتعزيز قدراتها بفضل تقنيات التعلم المتقدمة. ومن بين هذه التقنيات الجديدة، ظهر مفهوم DASH (Divergence-Adaptive Supervision Horizons) كأداة ثورية لتحسين كفاءة التعلم المعزز من خلال إشراف متكيف.
تقنية DASH تستند إلى تعزيز التعلم مع مكافآت يمكن التحقق منها (Reinforcement Learning with Verifiable Rewards)، حيث تعمل على تحسين قدرات التفكير للنماذج اللغوية باستخدام إشارات النتائج القابلة للتحقق بشكل تلقائي. ولكن، يواجه النظام العديد من التحديات مثل ندرة هذه الإشارات التي تكون غالبًا على مستوى التسلسل.
تأتي آلية التعلم الذاتي المتزامن (On-Policy Self-Distillation) كحل لعلاج هذه النقص، من خلال استجواب معلم يمتلك أفضليات في الأقسام التي زارها الطلاب، مما يوفر إشرافًا كثيفًا على مستوى الرموز. ومع ذلك، يبدو أن الطرق التقليدية لا تستفيد بشكل كافٍ من الهيكل الزمني للإصدار.
تقترح DASH حلًا مبتكرًا لتفادي هذه القيود، حيث تقوم بعملية خريطة للفجوة بين كل إشارة تقطير محلية والمتوسط على مستوى التسلسل إلى بوابة انتشار تكيفية، مما يتيح التحكم في التجميع متعدد الخطوات الراجع. وبالتالي، تتمكن DASH من تعديل أوزان الإشراف على مستوى الرموز اعتمادًا على كيفية تطور الانحرافات المحلية خلال عملية التوليد.
أثبتت التجارب على ثلاثة مؤشرات رياضية عبر ثلاث مقاييس نموذجية أن تقنية DASH تتفوق على نتائج الطرق التقليدية في كل القياسات، مما يمهد الطريق لمزيد من الابتكارات في علم الذكاء الاصطناعي.
تعرف على DASH: ثورة في تعزيز قدرات النماذج اللغوية عبر إشراف متكيف!
تقدم تقنية DASH ابتكاراً مذهلاً في تعزيز التعلم المعزز وتحسين قدرات التفكير للنماذج اللغوية الضخمة. من خلال إشراف متكيف، تساهم DASH في رفع مستوى الدقة والكفاءة في عملية التعليم الذاتي للنماذج.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
