في عالم الذكاء الاصطناعي، أصبحت نماذج اللغة الضخمة (Large Language Models) قادرة على كتابة عوالم ثلاثية الأبعاد تفاعلية بشكل كامل برمجيًا. ومع ذلك، يواجه المقيّمون صعوبة في تقييم هذه العوالم بدقة، حيث يعتمدون على وجهة نظر واحدة فقط. فالنموذج البصري (vision-language model) قد يقوم بتقييم عدد قليل من اللقطات المرسومة، بينما يقرأ نموذج اللغة فقط الشيفرة البرمجية.
ومؤخراً، تم التوصل إلى WorldBench، وهو معيار مبتكر ووسيلة تقييم متقدمة لتلك العوالم المولدة بواسطة نماذج اللغة الضخمة. يتيح هذا النظام تقييم العوالم من خلال استكشافها بشكل تفاعلي، حيث يتمثل التحدي في كتابة نص يتضمن جزيرة عائمة تتكون من عشرة بيئات، إضافةً إلى دورات فيزيائية وزمانية موسمية.
يعمل المقيّم على قياس الجوانب المختلفة للبيئة المولدة، مثل التحكم بالوقت، وتحديد موقع كل بيئة، وقراءة الشيفرة البرمجية المعنية. لكن بالرغم من قوتها، يعتمد التقييم على جمع الشهادات من المنصتين، فهو يعتبر الاقتباس البرمجي موثوقاً فقط إذا كان النص في المصدر، وتعتبر المطالبات البصرية مشروطة بفحص وحدات البكسل القابلة للقياس.
ما يميز WorldBench هو اختباره التكاثري، حيث يمكن إزالة ميزات معينة مبرمجياً ورؤية تأثير ذلك على الدرجات. أظهرت النتائج أن الحكم البرمجي وحده يمنح نقاطاً كاملة لميزات تمت إزالتها، بينما خفض المقيّم النقاط الممنوحة للميزات المزالة بمقدار الثلث، مما يدل على أهمية التقييم الشامل.
في النهاية، تم تقييم خمسة نماذج رائدة، مثل Claude Fable 5.1، وGPT-6 Astra، وKimi K3، وGrok 4.7، وGemini 3.1 Pro. يمكنكم الحصول على الشيفرة البرمجية، والنصوص، واختبارات الإعداد من خلال رابط GitHub.
ثورة الذكاء الاصطناعي: تقييم نماذج اللغة الضخمة في إنشاء العوالم الثلاثية الأبعاد
تقديم WorldBench، معيار مبتكر لتقييم العوالم ثلاثية الابعاد المولدة بواسطة نماذج اللغة الضخمة. يركز على حل مشكلة دقة التقييم من خلال دمج الجوانب البصرية والكود. اكتشف كيف أثبتت هذه المنهجية فعاليتها من خلال اختبارات حقيقية!
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
