في سعيها المستمر للتغلب على الفجوة بين المحاكاة والواقع، تبرز الأبحاث الحديثة في مجال الذكاء الاصطناعي نموذجًا رائعًا من نماذج الرؤية-اللغة-الإجراء (Vision-Language-Action) التي تم تدريبها باستخدام تقنيات تعلم التعزيز (Reinforcement Learning). في حين أن التدريب في العالم الحقيقي يعد طريقة فعالة، إلا أنه مقيد بقدرة النموذج على التعميم نظرًا للصعوبات المرتبطة بتنوع المشاهد والأشياء في الواقع.
يستعرض هذا العمل كيفية استخدام نماذج الجيل الثلاثي الأبعاد (3D Generative Models) لتوفير مشاهد متنوعة وثرية، مما يؤدي إلى تحسين نتائج التعلم بنسبة ملحوظة. فقد أظهرت التجارب زيادة في النجاح المحاكي من 9.7% إلى 79.8%، بالإضافة إلى تخفيض الوقت اللازم لإكمال المهام بنسبة 1.25 مرة.
كذلك، تم تحقيق تحسينات ملحوظة في انتقال النموذج من المحاكاة إلى الواقع، حيث ارتفعت نسبة النجاح من 21.7% إلى 75% بفضل جودة المشاهد المُنتَجة.
تُظهر هذه النتائج الوعد الكبير الذي تحمله نماذج الجيل الثلاثي الأبعاد في مجال الروبوتات، خاصة عندما يتعلق الأمر بتوفير بيانات غير محدودة لزيادة تنوع المشاهد. هذه الأبحاث تمثل خطوة جريئة نحو تحقيق نموذج موحد يعمل بكفاءة في كل من المحاكاة والعالم الحقيقي.
ثورة جديدة في تعلم التعزيز: كيف تسهم العوالم الثلاثية الأبعاد في تحسين نماذج الرؤية واللغة!
تستخدم الأبحاث الحديثة نماذج الجيل الثالث الأبعاد لتدريب نماذج الرؤية-اللغة-الإجراء بشكل فعال، مما يزيد من نجاحها في العالم الحقيقي. هل يمكن لهذه الطريقة أن تغلق الفجوة بين المحاكاة والواقع؟
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
