Ailoxa Logo

🏷️ #تعلم تعزيزي

51 مقال

دليل مبتكر لتحسين التعلم التعزيزي: اكتشف DADiff
أبحاث

دليل مبتكر لتحسين التعلم التعزيزي: اكتشف DADiff

أركايف للذكاءمنذ 6 ساعة
👁 1
إطلاق حدود عامة غير فارغة لتعميم التعلم التعزيزي مع مكافآت قابلة للتحقق
أبحاث

إطلاق حدود عامة غير فارغة لتعميم التعلم التعزيزي مع مكافآت قابلة للتحقق

أركايف للذكاءمنذ 3 يوم
👁 1
تعرف على SOReL: ثورة جديدة في التعلم التعزيزي Offline بالكامل
أبحاث

تعرف على SOReL: ثورة جديدة في التعلم التعزيزي Offline بالكامل

أركايف للذكاءمنذ 3 يوم
OOD-RL-Bench: الإطار الثوري لاكتشاف الحالات النادرة في تعلم التعزيز!
أبحاث

OOD-RL-Bench: الإطار الثوري لاكتشاف الحالات النادرة في تعلم التعزيز!

أركايف للذكاءمنذ 5 يوم
نسخة سياسية جديدة تعتمد على تحسينات مثبتة: ثورة في منهجيات التعلم التعزيزي لنماذج اللغة الكبيرة!
أبحاث

نسخة سياسية جديدة تعتمد على تحسينات مثبتة: ثورة في منهجيات التعلم التعزيزي لنماذج اللغة الكبيرة!

أركايف للذكاءمنذ 12 يوم
لا تدع المكاسب تتلاشى: تحليل الوزن المتغير للسياسات في التعلم التعزيزي!
أبحاث

لا تدع المكاسب تتلاشى: تحليل الوزن المتغير للسياسات في التعلم التعزيزي!

أركايف للذكاءمنذ 17 يوم
👁 1
تعلم الإمساك الماهر من توجيه تصنيفي محدود: كيف أحدثت تقنية GRIT ثورة في التحكم بالروبوتات!
روبوتات

تعلم الإمساك الماهر من توجيه تصنيفي محدود: كيف أحدثت تقنية GRIT ثورة في التحكم بالروبوتات!

أركايف للذكاءمنذ 19 يوم
👁 2
تطوير نماذج ذكاء اصطناعي موجهة لسلوكيات إيجابية: آفاق جديدة لنجاح مستدام
أبحاث

تطوير نماذج ذكاء اصطناعي موجهة لسلوكيات إيجابية: آفاق جديدة لنجاح مستدام

أركايف للذكاءمنذ 26 يوم
👁 1
ثورة التعلم التعزيزي: كيف يمكن للذكاء الاصطناعي تحسين عملاء الكمبيوتر ذاتياً؟
روبوتات

ثورة التعلم التعزيزي: كيف يمكن للذكاء الاصطناعي تحسين عملاء الكمبيوتر ذاتياً؟

أركايف للذكاءمنذ 26 يوم
👁 1
أهمية الجيولوجيا الوزن-space في تدريب التعلم التعزيزي الغير متصل: تحليل مثير!
أبحاث

أهمية الجيولوجيا الوزن-space في تدريب التعلم التعزيزي الغير متصل: تحليل مثير!

أركايف للذكاءمنذ 26 يوم
👁 1
أداء مذهل للذكاء الاصطناعي: إدارة استراتيجية هرمية في ألعاب متعددة الوكلاء!
أبحاث

أداء مذهل للذكاء الاصطناعي: إدارة استراتيجية هرمية في ألعاب متعددة الوكلاء!

أركايف للذكاءمنذ 1 شهر
تحديات جديدة في أمان الذكاء الاصطناعي: كيف تتلاعب وكالات نماذج اللغة بالمكافآت؟
أبحاث

تحديات جديدة في أمان الذكاء الاصطناعي: كيف تتلاعب وكالات نماذج اللغة بالمكافآت؟

أركايف للذكاءمنذ 1 شهر
سيطرة على الأمن: "PolicyGuard" للدفاع ضد هجمات المهاجمين لعمليات التعلم التعزيزي
أخلاقيات الذكاء الاصطناعي

سيطرة على الأمن: "PolicyGuard" للدفاع ضد هجمات المهاجمين لعمليات التعلم التعزيزي

أركايف للذكاءمنذ 1 شهر
تحويل النماذج: كيف يعيد التجديد مرونة التعلم من أجل تعزيز فعالية التعلم التعزيزي؟
أبحاث

تحويل النماذج: كيف يعيد التجديد مرونة التعلم من أجل تعزيز فعالية التعلم التعزيزي؟

أركايف للذكاءمنذ 1 شهر
👁 1
استكشاف عدم اليقين في المكافآت: خطوة جديدة في التعلم التعزيزي من خلال التغذية الراجعة البشرية
أبحاث

استكشاف عدم اليقين في المكافآت: خطوة جديدة في التعلم التعزيزي من خلال التغذية الراجعة البشرية

أركايف للذكاءمنذ 1 شهر
كيف يتعلم نموذج الذكاء الاصطناعي الأخطاء قبل أي تدريب: استكشاف فحص RLVR!
أبحاث

كيف يتعلم نموذج الذكاء الاصطناعي الأخطاء قبل أي تدريب: استكشاف فحص RLVR!

أركايف للذكاءمنذ 1 شهر
👁 1
SAAS: الابتكار الجديد في التعلم التعزيزي لإدارة البحث المفرط في الأنظمة الذكية!
أبحاث

SAAS: الابتكار الجديد في التعلم التعزيزي لإدارة البحث المفرط في الأنظمة الذكية!

أركايف للذكاءمنذ 1 شهر
استثمر في نتائجك: استراتيجية توزيع الموارد في التعلم التعزيزي بعد التدريب
أبحاث

استثمر في نتائجك: استراتيجية توزيع الموارد في التعلم التعزيزي بعد التدريب

أركايف للذكاءمنذ 1 شهر
تطوير UnityMAS-O: إطار عمل مبتكر لتحسين أنظمة الوكلاء المتعددة المعتمدة على نماذج اللغات الضخمة
أبحاث

تطوير UnityMAS-O: إطار عمل مبتكر لتحسين أنظمة الوكلاء المتعددة المعتمدة على نماذج اللغات الضخمة

أركايف للذكاءمنذ 1 شهر
ثورة في التعلم التعزيزي: إطار جديد لمقارنة الوحدات وإشكالية الطول
أبحاث

ثورة في التعلم التعزيزي: إطار جديد لمقارنة الوحدات وإشكالية الطول

أركايف للذكاءمنذ 1 شهر