في عالم تعلم الآلة، يمثل تحسين كفاءة الاختيار لبناء تجارب فعالة تحدياً معقداً، لا سيما في مجالات تعتمد على الصور. يواجه موديل تعلم التعزيز (Reinforcement Learning) صعوبة في التعامل مع المدخلات البصرية عالية الأبعاد، حيث يعتمد البعض على طرق اختيار عشوائية تؤدي إلى تحديثات مكررة وبطيئة في عملية التعلم.

لذلك، قامت دراسة حديثة بنشر نتائج مبتكرة تتعلق بتحسين كفاءة التعلم في بيئات الرؤية باستخدام نموذج جديد يسمى "مراجعة التجارب المعززة بالمفاجأة والابتكار" (Novelty and Surprise Prioritized Experience Replay - NSPER). يركّز هذا النموذج على تعزيز التجارب المعلوماتية عبر إعادة استخدام التحولات ذات القيمة العالية، بينما يشجع انفتاح التجربة على حالات جديدة أو غير مؤكدة.

بالإضافة إلى NSPER، تم تطوير تحسين أخر يحمل اسم NSPER+R، الذي يمزج بين إشارات المفاجأة والابتكار كمكافآت داخلية، مما يؤدي إلى تحسين جودة إعادة التشغيل وخيارات الاستكشاف بشكل مشترك.

أظهرت التجارب التي أجريت على مهام "ديب مايند" (DeepMind Control Suite) أن NSPER وNSPER+R يحسنون كفاءة التدريب وسرعة التقارب، مما يعكس نجاح هذا الابتكار في مواجهة التحديات التقليدية.

هذا التطور يفتح آفاق جديدة لتطبيقات الذكاء الاصطناعي، من خلال تحسين عمليات التعلم وزيادة كفاءتها، مما يضمن استكشافًا أعمق وأفضل للبيئات المعقدة.