في دراسة حديثة مثيرة، تم دفع حدود القدرة العقلية لنماذج اللغات الضخمة (LLMs) من خلال اختبارها في لعبة لغوية صينية تعرف باسم xiehouyu. ولاختبار هذه النماذج، استخدم الباحثون ألغازاً جديدة تم إنشاؤها بواسطة لغويين لضمان عدم وجود تداخل في البيانات السابقة. وقد تم تقييم أداء النماذج عبر أساليب متنوعة بما في ذلك الاختبارات متعددة الخيارات وإنتاج الشروح بحرية، بالإضافة إلى إنشاء ألغاز جديدة.
في الجانب الأول، اعتمدت الدراسة على نسبة الدقة (Δ_acc) بين ألغاز xiehouyu منخفضة التكرار والألغاز الجديدة كمعيار للذاكرة. أظهرت النتائج أن الدقة لدى الناطقين الأصليين كانت منخفضة جداً، مما يشير إلى وجود آليات معالجة مماثلة. ومع ذلك، كشفت نتائج النماذج الصينية المتقدمة عن متوسط دقة بلغ 23.6%، بينما كانت النماذج الإنجليزية البحتة أقل بكثير، حيث حققت متوسطاً بلغ 5.1%. هذا يشير إلى أن النماذج الصينية المتقدمة تم تدريبها على بيانات أكبر بكثير، مما أتاح لها حفظ المزيد من الألغاز التي تقل تكرارها.
عند اختبار قدرة النماذج على إنشاء ألغاز جديدة، أثبت نموذج Gemini 3.1 Pro كفاءة ملحوظة تصل دقتها إلى 92.6%، وهو ما يفوق دقة البشر بنسبة 24%. ومع ذلك، فإن الألغاز التي تم إنتاجها بواسطة نماذج اللغات الضخمة حصلت على تقييمات أقل بكثير مقارنة بتلك التي أنشأها البشر. وتثير هذه النتائج تساؤلات هامة حول ادعاءات القدرات الاستدلالية لنماذج اللغات الضخمة، وتدعو إلى إعادة تقييم دقيق لهذه القدرات، خاصة في مجال الإبداع اللغوي الذي قد يبقى فيه البشر في الصدارة، على الأقل في سياق الألغاز الصينية xiehouyu.
هل تستطيع نماذج اللغات الضخمة (LLMs) فهم وإنتاج ألغاز الصينية التقليدية؟ اكتشافات مثيرة!
تدور الدراسة حول إمكانيات نماذج اللغات الضخمة (LLMs) في فهم وإنتاج ألغاز xiehouyu الصينية، مع إظهار أن النماذج الصينية المتقدمة تتفوق بشكل ملحوظ. لكن هل يمكن أن تتفوق على إبداع البشر؟
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
