في عالم الذكاء الاصطناعي، أظهرت نماذج اللغة الضخمة (LLMs) تقدمًا مذهلاً في معالجة اللغات الطبيعية، لكن ما زال هناك العديد من الفجوات في فهمها للتعبيرات اللغوية المغروسة ثقافيًا. دراسة جديدة أُجريت لعرض نتائج نموذج جديد يسمى ProverbIT، وهو اختبار إيطالي يتكون من 100 سؤال متعدد الخيارات تم تصميمه لتقييم قدرة هذه النماذج على إكمال الأمثال الإيطالية.
تم تقييم 13 نموذجًا متقدمًا، بما في ذلك نماذج التفكير الكبيرة (LRMs) والنماذج التقليدية، عبر ثلاث مهام رئيسية: إكمال الأمثال، اختيار الخيارات المتعددة مع الإجابات الصحيحة، واختيار الخيارات المتعددة بدون إجابات صحيحة. النتائج كانت مفاجئة؛ حيث أظهرت معظم النماذج معرفة بالأمثال من خلال مهام الإكمال، لكن الأداء انخفض بشكل حاد عند الانتقال إلى تنسيقات الخيارات المتعددة بدون إجابات صحيحة، مما أظهر حتى أفضل نماذج التفكير انخفاضًا ملحوظًا.
من خلال تحليل مفصل لنموذجين من LRMs، تم الكشف عن تحيز قوي نحو اختيار المرادفات الحرفية، وغالبًا ما تذكر المعلومات الصحيحة أثناء التفكير دون النجاح في تحديد غيابها عن الخيارات المعطاة. هذه النتائج تشير إلى أن النماذج الحالية تعتمد بشكل كبير على الأنماط المحفوظة بدلاً من الفهم الدلالي الأعمق للتعبيرات المجازية الثقافية، مما يبرز القيود المهمة في قدراتها على الاستدلال وفهم اللغة المجازية.
تُبرز هذه الدراسة الحاجة إلى تحسين نماذج الذكاء الاصطناعي لتكون قادرة على الفهم العميق والتحليل الأكثر دقة للتعبيرات الثقافية، وهو ما يعد خطوة حيوية نحو الوصول إلى ذكاء اصطناعي مماثل لعقل الإنسان.
استكشاف أداء نماذج اللغة الضخمة على اختبار الحكم الإيطالي: نتائج مفاجئة!
تقدم دراسة جديدة تحليلًا لأداء نماذج اللغة الضخمة (LLMs) على اختبار ProverbIT الإيطالي. تكشف النتائج عن تفاوت كبير في القدرة على فهم الأمثال الثقافية والفهم السياقي.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
