في عالم تكنولوجيا المعلومات والذكاء الاصطناعي، تعتبر القدرة على بناء عوالم ثلاثية الأبعاد تفاعلية من استفسارات المستخدم أمرًا حيويًا. وللأسف، فإن الطرق الحالية غالبًا ما تقيم فقط على استفسارات مبسطة، مما يصعب علينا تحليل كيف يفهم الوكلاء متعددون الوسائط (Multimodal Agents) نوايا المستخدمين. هنا يأتي دور VibeWorlding، الإطار الجديد الذي تم اقتراحه كحل شامل لتدريب الوكلاء القادرين على استنتاج نوايا المستخدم، والتخطيط لتوزيع المشهد، واستدعاء أدوات ثلاثية الأبعاد، وكذلك التعامل مع التغذية الراجعة متعددة الوسائط خلال عمليات التفاعل.

في هذا السياق، تم بناء VWE-BENCH، وهو معيار يضم 2616 عنصر ثلاثي الأبعاد عالي الجودة، و323 عالمًا ثلاثي الأبعاد تم تصنيفها يدويًا، و6828 استفسارًا للمستخدمين مُعَاد تركيبها، مما يتيح تقييمًا موضوعيًا وقدرة أكبر على الاستجابة. يتضمن VibeWorlding-Gym بيئة مشتركة لعملية التدريب المعزز (Reinforcement Learning) حيث يتم دمج جميع أدوات استرداد العناصر وتحريرها وعرضها.

تشير التجارب إلى أن النماذج اللغوية الكبيرة الحالية لا تزال بعيدة عن إكمال مهمة وكيل VibeWorlding، حيث بلغ معدل النجاح للأنظمة مثل GPT-5.5 وQwen3.8-Max أقل من 60%. لكن التدريب المعزز قد يساعد في تجاوز هذه التحديات، حيث أثبت نموذج VibeWorlder-30B-A3B تفوقه في أداء نماذج أخرى، مع تحقيق أعلى معدل نجاح على الإطلاق.

ضمن الإبداع والابتكار، يمكن أن يكون VibeWorlding الخطوة التالية نحو بناء بيئات افتراضية غنية ومعقدة تعتمد على استفسارات المستخدمين الفورية. هل أنتم مستعدون لاكتشاف العالم الافتراضي الجديد الذي يقدمه هذا الابتكار؟