في عالم الذكاء الاصطناعي، يعكس الاستدلال المنطقي مستوى القدرات المعرفية لنماذج اللغة الكبيرة (Large Language Models)، التي باتت تستخدم في مجالات حساسة مثل الطب والقانون. الدراسة الجديدة المعنونة بـ "تقييم كفاءة نماذج اللغة على الاستدلال المنطقي باستخدام معاملات الاحتمالات"، تبرز التحديات الموجودة في قياس مدى قدرة هذه النماذج على تقديم استنتاجات صحيحة عند التعامل مع تعبيرات الشك.
خلال البحث، تم إنشاء معيار جديد يتضمن استدلالات على جمل تحتوي على عبارات احتمالية مثل "ربما" و"يجب"، مستندة إلى 14,320 نموذجًا إنجليزيًا مُنتَجًا بشكل منهجي. تمت معالجة 15 قالبًا مختلفًا للاستدلال، مما سمح بتغيرات في شكل السؤال، استراتيجيات النفي، ومحتوى الجمل.
وبمقارنة 29 نموذجًا، لاحظ الباحثون ميولًا للتحيز في الإجابات، مما يدل على تفضيل عميق للإجابات "نعم" أو "لا"، بغض النظر عن الشكل المنطقي. يظهر ما يسمى بـ "حد الكفاءة"، الذي يحدد أقل دقة ممكنة للنماذج على الأسئلة الصحيحة.
النتائج مثيرة للقلق، حيث أثبت أن 9 من أصل 29 نموذجًا فقط تتجاوز احتمالية الاختيار العشوائي. بالإضافة إلى ذلك، تم اختبار تأثير شكل السؤال، عبارات الأفعال، وكذلك جنس وأصل الأسماء المستخدمة في النماذج، لتظهر نتائج تشير إلى تحيزات متواجدة في كل المحاور.
ما رأيكم في هذه النتائج المثيرة؟ كيف ترون تأثيرها على مستقبل الذكاء الاصطناعي؟ شاركونا آراءكم في التعليقات.
تحدي الذكاء الاصطناعي: قياس كفاءة نماذج اللغة في الاستدلال المنطقي باستخدام معاملات الاحتمالات!
تظهر دراسة جديدة تحديات في تقييم استدلال نماذج اللغة الكبيرة على العبارات ذات الشكوك. مع وجود تحيزات واضحة، ماذا يعني ذلك لمستقبل الذكاء الاصطناعي؟
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
