في عالم الذكاء الاصطناعي المتسارع، تستمر نماذج اللغة الكبيرة (LLMs) في إبهارنا بقدرتها المذهلة على التعامل مع النصوص الطويلة الدقيقة. وقد أظهرت دراسة جديدة قُدمت في arXiv أن هذه النماذج تعزز قدرتها على العد من خلال آلية تسمى Chain-of-Thought (CoT). ولكن ما هي الآليات الداخلية التي تحرك هذا التحسن؟
تتبع هذه الدراسة آلية العد من خلال مهمة محددة تُسمى "البحث عن إبرة في كومة قش" (Needle-in-a-Haystack - NIAH)، حيث يمكن لنموذج اللغة الكبير أن يُطلب منه عد عدد من السجلات الموزعة عبر نصوص طويلة. وقد أظهرت النتائج أن النماذج التي تستخدم آلية التفكير تُسجل دقة أعلى في العد مقارنة بالنماذج غير المفكِّرة، خاصة عندما يتعلق الأمر بالأعداد الكبيرة.
يفرض هذا التحليل الآلي فصلًا بين آليتين متناقضتين:
1. **الاسترجاع الواسع**، حيث تحاول النماذج غير المفكِّرة التركيز على عدة نقاط في آن واحد.
2. **الاسترجاع المستهدف**، حيث تتبع النماذج المفكِّرة العد باستخدام جداول CoT لاسترجاع النقاط بشكل متعاقب، مما يؤدي إلى تركيز الانتباه على كل نقطة بشكل فردي ويتيح تمثيلات داخلية أكثر ضيقًا ووضوحًا.
علاوة على ذلك، اقترحت التحليلات أن النماذج المفكِّرة تستخدم رابط CoT للحفاظ على عدّ داخلي وتحديثه مع كل عملية استرجاع للنقاط، حتى من دون عدّ صريح. وفي تجارب صغيرة للتحكم، توضح هذه الدراسة كيف تظهر كل من آليات الاسترجاع وحالات العد تحت ظروف التدريب القياسية.
باختصار، ترجح النتائج ارتباط عمليات الاسترجاع في النصوص الطويلة بمعمارية هندسية للعد، مما يدعم فرضية تتبع الحالات في آلية التفكير. لذا، في عالم تتضاعف فيه الإمكانيات، كيف ستسهم هذه الآلية الجديدة في المستقبل؟
كيف تعزز آلية التفكير في نماذج اللغة الكبيرة (LLMs) دقة العد في النصوص الطويلة؟
توضح دراسة جديدة فوائد آلية التفكير في نماذج اللغة الكبيرة (LLMs) في تحسين دقة العد داخل النصوص الطويلة. تسلط النتائج الضوء على آلية الاسترجاع المستهدف ودورها في تركيز الانتباه وتعزيز دقة الأداء.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
