في عالم تكنولوجيا الذكاء الاصطناعي، تتزايد أهمية تطوير بيئات ثلاثية الأبعاد تفاعلية لدراسة سلوكيات الذكاء. ومن أجل ذلك، تم تقديم نظام **WorldAuditBench**، وهو معيار حديث للتدقيق في هذه البيئات.

إن التدقيق في العوالم ثلاثية الأبعاد يمثل تحدياً معقداً يتطلب دمج شعورين مختلفين تماماً: القدرة على اتخاذ إجراءات للتنقل عبر هذه العوالم بحثاً عن الشذوذات، والقدرة على التفكير البصري لفهم البيئة المحيطة.

حيث يمكن لنماذج الذكاء الاصطناعي المتعددة الوسائط، مثل نماذج الرؤية واللغة (Vision-Language Models) ونماذج الرؤية واللغة والإجراء (Vision-Language-Action Models)، أن تلعب دوراً مهماً في أتمتة هذه العملية. ومع ذلك، فإن ربط هاتين القدرتين لا يزال بحاجة إلى استكشاف فعّال.

تتضمن **WorldAuditBench** 213 مهمة لفحص الشذوذات عبر 13 بيئة تم إنشاؤها باستخدام **Unreal Engine 5** و**Three.js**، ومرتبة في خمس فئات للشذوذات. خلال التجارب، تم تقييم خمسة نماذج متقدمة باستخدام اثنين من أشهر طرق التدقيق.

تتراوح معدلات النجاح بين النماذج من 6.6% إلى 42.3%، مما يشير إلى وجود فجوة كبيرة بين أداء هذه النماذج والأداء البشري الذي يصل إلى 83.4%.

يمثل WorldAuditBench فرصة رائعة لدراسة كيفية قيام الوكلاء المتعددين الوسائط بربط القدرة على اتخاذ الإجراءات والتفكير البصري في بيئات ثلاثية الأبعاد.

مما لا شك فيه أن التطورات في هذا المجال ستفتح آفاق جديدة لفهم وتطبيق الذكاء الاصطناعي في سياقات متعددة. ما رأيكم في هذه الابتكارات؟ شاركونا في التعليقات!