تشهد نماذج اللغة الضخمة (Large Language Models) لحظات تحول مهمة بفضل الابتكارات الحديثة، حيث تسعى إلى تحقيق تحسين ذاتي فعّال. في هذا الإطار، ظهرت الابتكارات الجديدة التي تجمع بين تطوير السياسات وداخل تجربة التفاعل.
شهدت المفاهيم الحالية تحسينات ملحوظة، ولكنها تعاني من تفتت في أنماط التحسين الذاتي. على سبيل المثال، يمكن أن تستخرج بعض الأساليب المستخدمة في زمن الاختبار الخبرة بشكل صريح، لكنها تواجه صعوبة في دمجها ضمن معلمات النموذج. بينما يمكن لأساليب تحسين التدريب تحديث المعلمات، فإنها تفتقر إلى الآلية اللازمة لتجميع الخبرة القابلة للتحويل.
لهذا، تم تقديم نموذج SPEE (تطور التجربة الذاتية التدريجية) كإطار عمل موحد يمتاز بالتطور الواضح للتجربة، يتبعه تحسين غير صريح للسياسات. وفي مرحلة التطور، يركز SPEE على تحليل المسارات من تفاعلات متعددة بهدف استخراج وتحقق وتطوير الخبرة القابلة للتحويل، والتي يتم دمجها لاحقاً في السياسة من خلال عملية تدعى On-Policy Self-Distillation (OPSD).
عبر تقنيات التعلم المعزز القائم على المكافأة، تستفيد دراسات انتصارات النموذج من هذه المعارف المدمجة لاستكشاف استراتيجيات جديدة. في مرحلة التطور، يقوم نموذج SPEE بتجميع المعرفة من مسارات مختلفة، مما يضمن تصفية التجارب ذات الفائدة المنخفضة وتقليل التبريرات المفرطة الناتجة عن المسارات الفردية.
تظهر التجارب على خمسة معايير للمنطق الرياضي أن SPEE يتفوق بانتظام على القواعد السابقة في زمن الاختبار والتدريب، مما يتيح مساراً جديداً للذكاء الاصطناعي. مزيد من المعلومات ورمز المصدر متاحة على الرابط.
نماذج لغوية ضخمة تتطور ذاتياً: كيف يغير SPEE مشهد التعلم الآلي؟
تقدم دراسة جديدة نموذج SPEE الذي يعزز من قدرة نماذج اللغة على التعلم الذاتي، متجاوزة الثغرات الحالية في هذا المجال. أسلوب الابتكار هذا يعد بتطوير استراتيجيات جديدة في الذكاء الاصطناعي.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
