تتطلب نماذج الفيديو التفاعلية قدرتها على التخطيط والاستكشاف على المدى الطويل، لكن هذه النماذج غالباً ما تعاني من أخطاء متزايدة. إن اعتماد أساليب ما بعد التدريب مثل التعلم المعزز (Reinforcement Learning) يعزز من فعالية هذه النماذج، لكنها تواجه عقبة التحقق: فلا توجد حالة مستقبلية حقيقية لقياس انحرافات الزمن الطويل عن النتائج.
لكن ماذا لو كان بالإمكان التحقق من صحة هذه النماذج؟ الإطار الفريد الذي نقدمه هنا، WorldCycle، يوفر حلاً مبتكراً من خلال ما يُعرف بدورات الأفعال القابلة للعكس التي تجعل هذا التحقق ممكنًا. فإذا كان لدينا تسلسلاً يتكون من إجراءه وعكسه، يجب أن يعود إلى الوضع الأصلي بشكل تحليلي، مما يتيح لنا الإشراف بدون علامات على صحة التنبؤات المتعلقة بالزمن الطويل.
يعتمد WorldCycle على بناء دورات الأفعال المغلقة وتنفيذها المتكرر من تسلسلات الأفعال العادية، ويعمل على تحسين جائزتين تكميليتين: جائزتان، واحدة لتحقيق الإغلاق المكاني التي تعزز التماثل بين الأجزاء الأمامية والعكسية، وأخرى للمطابقة الزمنية التي تتماشى بين الحالات عبر دورات تنفيذ متكررة. هذه المكافآت تضطر النموذج إلى التعلم بطريقة متناسقة كعوامل حالة بدلاً من أنماط زمنية محفوظة.
علاوة على ذلك، تم إطلاق CycleBench، وهو معيار تشخيصي لقدرة العودة إلى الحالة في ظل هياكل العمل المعقدة. أثبتت الأبحاث أن WorldCycle تستطيع تقليل انحراف العودة إلى الحالة بنسبة تصل إلى 44% وزيادة دقة الأفعال المركبة لأربعة أضعاف مقارنة بالنموذج الأساسي، مما يوفر أساسًا حيويًا لنماذج العالم المرتبطة بالواقع.
ثورة في التعلم المعزز: إطار عمل WorldCycle لإعادة التحقق الذاتي في نماذج الفيديو!
يقدم إطار عمل WorldCycle طريقة فريدة لتجاوز قيود التعلم المعزز عبر ضمان دقة طويلة الأمد. يكشف عن طريقة ثورية لجعل نماذج الفيديو أكثر فعالية في التخطيط والاستكشاف.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
