في دراسة مثيرة نُشرت على منصة arXiv، تم تدريب نموذج لغوي Transformer يتكون من 318 مليون معلمة من الصفر على مجموعة من النصوص الصينية الكلاسيكية تجاوزت 1.56 مليار رمز، دون استخدام أي أحرف إنجليزية أو أرقام عربية. من خلال اختبارات منهجية خارج نطاق البيانات (OOD)، تمكن الباحثون من التحقيق ما إذا كان النموذج يستطيع تمييز المعلومات المعروفة عن غير المعروفة، وما إذا كان يستطيع التعبير عن هذا التمييز في نصوصه المولدة.
أظهرت النتائج وجود تباين واضح بين عدم اليقين الداخلي والخارجي. داخلياً، سجل النموذج زيادة في صعوبة الفهم (perplexity) بنسبة تصل إلى 2.39 بين الأحداث التاريخية الحقيقية والمصنوعة، مع تسجيل الأحداث شبه المصنعة (شخصيات حقيقية + أحداث خيالية) أعلى مستوى من الصعوبة (4.24). هذا يظهر قدرة النموذج على ترميز المعلومات الحقيقية بعيداً عن محاكاة الأنماط النحوية.
ومع ذلك، على الصعيد الخارجي، لم يتعلم النموذج أبداً كيفية التعبير عن عدم اليقين، حيث ظهرت علامات المعرفة التقليدية في الصينية بمعدلات أقل في الأسئلة خارج نطاق البيانات (3.5%) مقارنة بالأسئلة ضمن النطاق (8.3%). هذه النتائج تعكس التقاليد البلاغية في بيانات التدريب بدلاً من الإبداع المعرفي.
تم تكرار هذه النتائج عبر ثلاث لغات (الصينية الكلاسيكية، الإنجليزية، اليابانية) وثلاث نظم كتابة، مما يدل على أن تكرار التعبير عن عدم اليقين يعتمد تماماً على تقاليد البيانات التدريبية وليس على الحالة المعرفية. كما تبيّن أن نماذج الصينية الكلاسيكية تظهر "مفارقة التواضع" (أكثر تردداً في المواضيع المعروفة)، بينما نماذج اليابانية نادراً ما تظهر التردد.
تطرح هذه الدراسة تساؤلات مثيرة حول كيفية ظهور التعبير عن المعرفة المعرفية، مدعية أن هذه القدرة لا تنشأ من نمذجة اللغة وحدها، بل تتطلب إشارات تدريب صريحة مثل التعلم المعزز من التغذية الراجعة (RLHF).
اكتشاف حدود التعميم: نموذج لغوي صيني كلاسيكي يتجاوز التحديات المعرفية
تم تدريب نموذج لغوي مكون من 318 مليون معلمة على نصوص صينية كلاسيكية، ليكشف عن تباين واضح في معالجة المعلومات المعروفة وغير المعروفة. تعكس النتائج الصريحة حاجة للنماذج لتعلم التعبير عن عدم اليقين.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
