في عالم الذكاء الاصطناعي، يظهر التعلم المعزز (Reinforcement Learning) كاستراتيجية قوية تعزز من قدرات التفكير في نماذج اللغات والرؤية اللغوية. رغم نجاحاته الكبيرة، لا تزال هذه الاستراتيجيات تعتمد على إشراف صارم وتحديد واضح للعواقب من قبل البشر. وهذا ما يجعل الحصول على هذه التقييمات مكلفًا ونادرًا بشكل متزايد مع تقدم قدرات التفكير. ولكن، ماذا لو استطاعت النماذج التعلم من تجاربها الخاصة دون الاعتماد على إشراف خارجي؟
تقدم Co-RL (Cooperative Reinforcement Learning) إطارًا جديدًا يقوم على تدريب نماذج متعددة غير مرتبطة، حيث يتم تحسينها في وقت واحد وتعتمد على المكافآت المستنبطة من أداء الأقران. هذه الطريقة تسمح بإقامة تعاون بين النماذج دون الحاجة إلى مشاركة أي معلمات.
لقد أظهر فريق البحث أن زيادة تنوع الفرق - بما في ذلك عائلات نماذج مختلفة وأحجام متعددة ونماذج تدريب معاد صياغتها - يقلل من الأخطاء المرتبطة التي تؤدي إلى حلقات تغذية راجعة سلبية. وبالتالي، يعزز هذا التنوع من أداء التفكير، ويحافظ على تنوع السلوك، ويقلل من الانهيار في التدريب.
عبر مجالات النصوص فقط والرؤى الهوائيات المتعددة، أثبتت Co-RL أنها تتفوق باستمرار على النماذج الأساسية والنهج السابقة التي لا تتطلب تسميات، بل وتتنافس مع الطرق المُراقبة دون الحاجة للوصول إلى أي تراخيص أو بيانات حقيقية.
النتائج؟ أظهرت Co-RL مكاسب تتراوح بين 3.0-8.6% عبر سبعة مقاييس مختلفة للنماذج اللغوية و2.3-7.2% عبر أربعة مقاييس للنماذج متعددة الاستخدامات. فهل نحن أمام ثورة حقيقية في كيفية تعليم الآلات التفكير؟
ابقوا على اطلاع دائم ونتابع تأثيرات هذه الابتكارات على مستقبل الذكاء الاصطناعي.
ثورة في التعلم المعزز: ظهور التفكير غير المراقب عبر التعاون بين الوكلاء!
تقدم Co-RL نموذجًا جديدًا في التعلم المعزز يُظهر كيف يمكن لتنوع النماذج التدريبية أن يعزز مهارات التفكير غير المراقب. هذا الابتكار يعد بتحسين الأداء اللغوي والرؤى متعددة النموذج بشكل كبير.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
