في عصر الذكاء الاصطناعي المتقدم، تبرز Code4Scene كمعيار حيوي لاختبار وكالات البرمجة التي تمثل المستقبل في إنشاء وتحرير المشاهد ثلاثية الأبعاد. حيث يمكن لوكالات الترميز الحديثة كتابة وتنفيذ الأكواد التي تصف بيئات ثلاثية الأبعاد. ولكن السؤال الذي يظل قائمًا هو: هل تفهم هذه الوكالات فعلاً البنية المعقدة لهذه المشاهد وتستطيع التحكم في حالة المشهد بدقة؟

تقدم Code4Scene معيارًا يتألف من 190 حالة مبنية من مشاهد تم تجميعها بشريًا باستخدام محرك Unreal Engine. يتم تقييم وكالات البرمجة عبر إعدادين مختلفين وفقًا لواجهة تنفيذ مشتركة. تتطلب اختبارات البناء تفكيرًا مكانيًا على مستوى المشهد من خلال مواصفات لغوية مفتوحة، بينما تركز اختبارات التحرير على التحكم الدقيق في حالة المشهد، حيث يجب على الوكالات استعادة المشهد المستهدف استنادًا إلى صور مرجعية مع الحفاظ على العناصر الأخرى كما هي.

بدلاً من تقييم الأكواد أو العرض المرئي، تقوم Code4Scene بتقييم المشهد الناتج الذي يعمل فيه المحرك الأساسي من حيث تنفيذ المهمة وسلامة القطع وصلاحيتها الفيزيائية الثابتة. على سبيل المثال، يظهر تحليل البيانات أن الأداء في البناء والتحرير مرتبطان بشدة ولكنهما ليسا قابلين للتبادل، مما يعني أن النجاح في واحدة لا يعني التفوق في الأخرى.

بالمجمل، نجد أن أداء Claude Fable 5.1 يتصدر في البناء، بينما يتفوق Gemini 3.8 Flash في التحرير، ويمتاز GPT-6 Astra بفضل أدائه العام. لكن على الرغم من هذه الإنجازات، فإن فئة التركيب المكاني بقيت الأكثر ضعفًا من حيث الأداء، وتبقى عمليات التحرير غير دقيقة، حيث أن أفضل معدل لإصلاح النقاط F1 لا يتجاوز 0.527، مع 35.8% من التعديلات التي تعيد المشهد المستهدف، مما ينتج عن تغييرات غير مقصودة في أماكن أخرى.

تكشف هذه النتائج عن فجوة بين القدرة على توليد بيئات ثلاثية الأبعاد المعقولة والقدرة على التفكير المكاني الموثوق والتحكم في الحالة. لذا، يبقى السؤال: كيف ترى تطور وكالات البرمجة في مجال إنشاء وتحرير المشاهد ثلاثية الأبعاد؟ شاركونا آراءكم في التعليقات!