في عالم التعلم التعزيزي (Reinforcement Learning)، تعتبر فجوة التعميم (Generalization Gap) مفهومًا محوريًا يُستخدم لقياس أداء النماذج. تُحسب هذه الفجوة من خلال قياس الفرق بين العائدات أثناء التدريب والعائدات عند تقييم النموذج على بيانات محجوبة. ولكن ماذا لو قلنا أن هناك نقطة مرجعية أخرى مهمّة؟ يطرح الباحثون مفهوم "السطح العشوائي" (Random Floor) كأداة لفهم كيف يمكن للنماذج أن تؤدي في سياقات مختلفة.

من خلال دراسة شملت ثمانية بيئات (ProcGen) باستخدام خوارزمية PPO، نجد أن تقرير الأرقام القياسية يجب أن يتم مقارنة بعد تطبيق السطح العشوائي، حيث يمثل هذا السطح أداء سياسة عشوائية على مستويات الاختبار نفسها. النتائج تُظهر أن بعض السياسات تكون أداؤها مرتفعًا بشكل كبير عند قياسها مقابل هذا السطح، بينما أخرى قد تبدو أقل أداءً مما يُعتبر مقبولًا.

في العديد من الحالات، يعتمد أداء السياسة على قواعد معينة تم استخدامها في الاختبار. على سبيل المثال، في لعبة miner، تحقق سياسة عينة نتائج أعلى بخمسة أضعاف من السطح العشوائي، بينما سياسة argmax تظل تحتها في جميع المحاولات. أيضًا، يجد التقرير أن توزيع السلوك في عدة بيئات قد لا يُقدّم معلومات دقيقة بدون تحديد القواعد المستخدمة في اختبار الأداء.

نوصي بأن تُذكر فجوات التقييم دائمًا مع قواعد العمل، وأن تُستخدم البذور المناسبة لكل تقييم، وبالطبع يجب الإبلاغ عن السطح العشوائي بالنسبة لمجموعات المستويات المستخدمة. هذه الخطوات تسهم في تقديم تقييمات أدق ويمكن أن تحدث فرقًا كبيرًا في تحليل العوامل المختلفة في التعلم العميق.