في عالم الذكاء الاصطناعي، تواجه نماذج اللغة الكبيرة (LLMs) تحديات متزايدة في تقييم مهارات حل المشكلات الإبداعية. ولتسليط الضوء على هذا، قدم الباحثون معيار CresOWLve، الذي يهدف إلى قياس قدرات التفكير الإبداعي من خلال مجموعة متنوعة من الألغاز التي تستند إلى المعرفة الواقعية. يتضمن CresOWLve 2,061 مثالًا موزعًا على خمس مستويات من الصعوبة.

تتطلب الألغاز في CresOWLve استخدام استراتيجيات تفكير إبداعية متعددة، واسترجاع حقائق من مجالات متنوعة، ودمجها بشكل مبدع للوصول إلى الحلول. وقد أظهر التحقيق في الأداء أن هناك فجوة ملحوظة في أداء النماذج: فهي تحقق نتائج أفضل بكثير في الأسئلة المتعلقة بالحقائق مقارنة بتلك التي تحتاج إلى تفكير إبداعي، حيث يمكن أن تصل نسبة الانخفاض في الأداء إلى 17%.

يعتبر هذا البحث خطوة مهمة نحو فهما أفضل للتحديات التي تواجه الذكاء الاصطناعي في تطبيق التفكير الإبداعي في سيناريوهات العالم الحقيقي، مما يمكن أن يفتح آفاقًا جديدة في تطوير نماذج قادرة على التفكير الإبداعي وتقديم حلول مبتكرة. في ظل تضاعف الاعتماد على الذكاء الاصطناعي في مختلف المجالات، يبقى السؤال الأهم: كيف يمكننا تحسين أداء هذه النماذج لتلبية احتياجات العالم الحقيقي؟