في عالم الذكاء الاصطناعي (Artificial Intelligence)، يعتبر تحسين الأداء أمرًا بالغ الأهمية، وخصوصًا عندما يتعلق الأمر بنماذج التحكم الدقيق في الروبوتات. في دراسة جديدة تم نشرها على منصة arXiv، تم تقديم مفهوم مبتكر يُعرف باسم تحسين نموذج العالم عبر تجربة مباشرة (Direct Experience World-Model Optimization - DEWO).
يعمل نموذج العمل هذا على دمج generation actions مع توقعات حول كيفية تطورات التفاعلات الفيزيائية. وبالرغم من أن أغلب نماذج التعلم الحالية تحسن سلوك النظام دون الحاجة لتوقعات أفضل عن العالم، إلا أن DEWO يتجاوز هذه القيود. هذه التقنية الجديدة تتعامل مع الأخطاء الطفيفة التي يمكن أن تتراكم في فضاءات الحركة الكثيفة، مما يعوق تحسين السياسات ويدفع التفاعلات بعيدًا عن نطاق تدريب النموذج.
مبنية على هذا المفهوم، يسعى DEWO إلى تحسين التمثيلات العالم من خلال التجارب المرئية، مما يعزز بشكل أكبر من توليد الحركة. يقوم النظام بالتعرف على نقاط التحول في التفاعلات ويتعلم من المسارات الناجحة والفاشلة لدعم توجيه без classifiers. كما تشمل قيمة إضافية تقدير تقدم المهمة بناءً على تمثيلات الفيديو، ما ينشط التوجيه عندما يتوقف التقدم خلال مرحلة الاستنتاج.
في اختبارات على خمسة مهمات ضمن DexJoCo، أثبت DEWO أنه يحسن معدلات النجاح لجميع أشكال نموذج حركة العالم (WAM). وتظهر النتائج أن التعلم المبني على التجارب المرئية من الاستمرارات الناجحة والفاشلة يعزز القدرة على التحكم والتوقع بشكل يفوق التعلم المستند إلى الحركة فقط.
علاوة على ذلك، في أربع مهمات حقيقية عبر Wuji وSharpa، أظهرت تقييمات شبكة 3 × 3 أن جولات التعلم التي تمت على مدى انخفاض الأداء أدت إلى زيادة في النجاح من 51.0% إلى 71.7%، وهو تحسن ملحوظ بمقدار 20.7 نقطة مئوية. هذه النتائج تدعم استمرار التعلم التنبؤي كوسيلة لتعزيز القدرة على التحكم من خلال تجارب التنفيذ، مما يجعل نمذجة العالم جزءًا نشطًا من عملية تكيف WAM.
ابتكار مذهل: تحسين نموذج العالم عبر تجربة مباشرة لتعزيز التحكم في الذكاء الاصطناعي!
تقدم دراسة جديدة مفهوم تحسين نموذجات العالم المباشرة (DEWO) الذي يربط بين تعلم النماذج والنجاح المستند إلى التجربة. هذا الابتكار يعد بتحسين كبير في القدرة على التحكم في الروبوتات.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
