في إطار سعي العلم لفهم العقل البشري وتقنيات الذكاء الاصطناعي (AI)، أُطلق مشروع "CogGym"، الذي يقدم نظام تقييم موحد وقابل للتوسع لمقارنة سلوكيات البشر والآلات. مع تزايد قدرات نظم الذكاء الاصطناعي، يبقى السؤال: كيف تشبه استجابات النماذج البشرية، وأين تختلف عنها؟
يلقي هذا المشروع الضوءَ على التحديات الشائكة التي يواجهها الباحثون عند محاولة تقييم أداء البشر والآلات بشكل منهجي. يستند "CogGym" إلى معايير علم النفس المعرفي، حيث يسعى لتوحيد التجارب المتنوعة في لغة تجريبية محددة (Experiment Markup Language - EML).
أطلقنا النسخة الأولية من "CogGym"، التي تتضمن 258 تجربة معرفية تم تحضيرها ومعايرتها من 100 ورقة بحثية، حيث تركز على التفكير العام السليم لدى البشر. وابتكرنا آلية شبه آلية، تتضمن وجود الإنسان في دورة الاختبار، مما يسمح بإجراء مقارنات دقيقة وقابلة للتكرار على نطاق واسع.
أظهرت تقييماتنا لـ 50 نموذجًا من نماذج اللغة الكبيرة (Large Language Models) مقابل ردود البشر نتائج مثيرة. فكلما كانت النماذج أكبر وأحدث، زادت قدرتها على تقليد الأحكام البشرية، ومع ذلك، فإن معدل تحسن النماذج في مهام التفكير العام أقل بكثير من التقدم الملحوظ في مجالات القياس الرسمي مثل الرياضيات أو البرمجة.
تظهر القياسات أن توافق النماذج مع حكم البشر لا يزال أقل بكثير من موثوقية الحكم البشري، حيث بلغ معامل التوافق لنصوص 0.59، وللصورة 0.58، و0.43 للفيديو. نحن نهدف إلى أن يكون "CogGym" إطار تقييم حي يتطور باستمرار، حيث يدمج التجارب الجديدة من علم النفس المعرفي لتحديد أوجه الشبه والاختلاف بين سلوكيات النماذج والبشر، وكيف تتغير هذه الأنماط كلما تطورت النماذج والتجارب.
ما رأيكم في هذا التطور الثوري؟ شاركونا في التعليقات!
ثورة CogGym: تقييم شامل للعقل البشري والذكاء الاصطناعي
تقدم CogGym إطارًا موحدًا وموسعًا يقيم سلوكيات الذكاء الاصطناعي مقارنة بالعقل البشري، عبر خوض تجربة 258 اختبارًا معرفيًا. تكشف النتائج عن تحسن تدريجي في أداء النماذج الحديثة، لكنها لا تزال بعيدة عن مستوى الحكم البشري.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
