في السنوات الأخيرة، أصبحت أنظمة الذكاء الاصطناعي قدراً كبيراً من الوعود، حيث تسعى لتحقيق اكتشافات علمية مستقلة، مثل وضع خوارزميات جديدة وكتابة أبحاث علمية. ولكن السؤال الرئيسي الذي يطرح نفسه هو: هل تتمتع هذه الأنظمة بالإبداع؟

قدمت دراسة حديثة إطار عمل لتقييم إبداع الوكلاء المعتمدين على نماذج اللغة الضخمة (LLM)، باستخدام مهام الهندسة الآلية كاختبار. هذا التقييم يتم عبر ثلاثة أبعاد رئيسية:

1. **الإبداع النفسي (P-Creativity)**: وهو الإبداع المرتبط بالحلول الجديدة مقارنةً بما قدمه نفس الوكيل في السابق.
2. **الإبداع التاريخي (H-Creativity)**: يقيس مدى جدّة الحلول مقارنةً بمجموع الحلول التي قدمها البشر.
3. **الجدوى (Usefulness)**: مدى أداء المهمة بشكل فعّال.

وتمت مقارنة إطار عملين، AIDE و AIRA-Dojo، على خلفية عشرة مهام مشابهة لمهام كاجل من MLE-Bench. أثبتت النتائج وجود علاقة قوية بين تقييمات الإبداع للإنسان والمعايير الآلية المقدمة.

بالنسبة لنتائج التقييم، تبين أن:
1. جميع الوكلاء يظهرون تراجعاً في الإبداع النفسي أثناء انتقالهم من مرحلة استكشاف الحلول إلى مرحلة الاستغلال.
2. أظهرت نماذج LLM قدرة أكبر على الإبداع التاريخي مقارنةً بأفضل البشر، ولكن الأداء الفعلي كان أقل.

هذه النتائج تكشف أن الوكلاء الحاليين يمكنهم استكشاف مجالات جديدة من الحلول، إلا أنهم يفتقرون إلى القدرة على تحويل هذا الإبداع إلى أداء أفضل في المهام.