في عالم الذكاء الاصطناعي، يبقى سؤال الإبداع الأصلي حاضرًا بقوة، خاصةً عندما يتعلق الأمر بنماذج اللغة الكبيرة (Large Language Models) التي تنتج مخرجات تبدو في ظاهرها مبتكرة. في هذا السياق، تم تطوير معيار ALPS - Austin-Law Proof-Synthesis - الذي يهدف إلى قياس الإبداع الفعلي وليس فقط إنتاج محتوى مشابه لما تم تدريبه عليه.

من خلال تصميم مهام رياضية تتطلب إنتاج حلول أصلية قابلة للإثبات، تم تزويد ALPS بآلية تحقق آلي لضمان عدم تدخل العنصر البشري. تتضمن المهام تقديم قوانين رياضية تتعلق بإنشاء هياكل رياضية لانهائية إثباتًا لوجودها، أو إثبات عدم وجود مثل هذه الهياكل. يعكس هذا التحدي صعوبات كبيرة، حيث تمكن البروفرز الآليين من حل 2.2% فقط من مجموعة القوانين البالغ عددها 4,141، وعندما تم زيادة ميزانية الاختبارات بعشرين ضعفًا، ارتفع النسبة إلى 0.6% فقط.

تمكن النموذج الأقوى الذي تم اختباره من تحقيق نجاح بنسبة 14% في المهام المتعلقة بالبرهان، بينما لم يُحقق أي نجاح في الجانب الإنشائي. تظل نسبة 97.2% من القوانين بلا حل عند كل التكوينات والميزانيات المستخدمة.

يُعد معيار ALPS خطوة فاصلة تحمل في طياتها آمالًا جديدة لفهم وتقييم الإبداع في الذكاء الاصطناعي، حيث يتم إصدار جميع بياناته وآلياته للتحقق.

ما رأيكم في أهمية قياس الإبداع في الذكاء الاصطناعي؟ هل تعتقدون أن هذه الخطوة ستشكل تحولًا كبيرًا في هذا المجال؟ شاركونا آراءكم في التعليقات!