تُظهر نماذج اللغات الضخمة (Large Language Models) قدرة مذهلة على إتقان النحو، لكن عملية تعلمها للعلاقات الدلالية العميقة (Deep Semantic Dependencies) لا تزال محاطة بالغموض. في هذه الدراسة الجديدة، نقترح إطارًا ميكانيكيًا يسلط الضوء على آليات هذا التعلم، مبرزين كيف تقوم نماذج التحويل (Transformers) بالمنافسة بين إحصائيات السطح (Surface Statistics) والدلالات العميقة.
تكشف التحليلات النظرية عن ظاهرة تُعرف باسم "جوع التدرجات" (Gradient Starvation)، حيث يتم قمع إشارات الخطأ للعلاقات الدلالية النادرة خلال مراحل التحسين الأولية. هذه الظاهرة تؤثر سلبًا على تعلم التفكير الهيكلي، مما يؤدي إلى ظهور مفاجئ لهذه القدرة كمرحلة انتقالية.
علاوة على ذلك، يوفر هذا الإطار أساسًا ميكانيكيًا لفعالية استراتيجيات "سلسلة التفكير" (Chain-of-Thought). من خلال تحويل خطوات التفكير الوسيط إلى رموز ملموسة، تتجاوز هذه الاستراتيجية القيود المترتبة على التفكير الضمني.
لقد قمنا بتقييم هذه النتائج عبر نماذج مختلفة، بدءًا من نماذج التحويل الصغيرة وصولاً إلى طرازات الإنتاج مثل لاما 3.1 (Llama 3.1) وكود Qwen 2.5 (Qwen 2.5). وأخيرًا، استنادًا إلى هذه النظرية، اقترحنا هدفًا تباينيًا متماشيًا مع التوبولوجيا (Topology-Aligned Contrastive Objective) الذي يعالج بشكل صريح هندسة التدرجات. أظهرت التجارب في مهام ربط المتغيرات أن طريقتنا تحقق تحسنًا يزيد عن الضعف مقارنةً مع تحسين الانتروبي المتقاطع القياسي.
فهم أعمق: كيف تتعلم نماذج التحويل (Transformers) العلاقات المعقدة بين المعاني والهيكلية!
تكشف نماذج اللغات الضخمة عن طلاقة نحوية مذهلة، لكن طريقة تعلمها للعلاقات الدلالية العميقة لا تزال غامضة. نقدم إطارًا ميكانيكيًا لفهم هذه الديناميكيات المعقدة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
