في عالم الذكاء الاصطناعي، تعتبر نماذج اللغة الكبيرة (LLMs) من أبرز التطورات التكنولوجية التي جذبت اهتمام الباحثين. واحدة من أبرز قدراتها هي التنبؤ بالملاحظات المقبلة باستخدام نماذج ماركوف الخفية (HMMs) من خلال التعلم في السياق (ICL). ولكن ما زالت الخوارزمية التي تدعم هذه القدرة قيد النقاش، وذلك بعد أن تم اقتراح عدة نماذج دون اتفاق حول أي منها هو الصحيح.
لملء هذا الفراغ، قام الباحثون بتطوير أسلوب عمل يتكون من ثلاث مراحل. في المرحلة الأولى، تم إجراء مقارنة تجريبية بين سلوك نماذج اللغة الكبيرة ومجموعة من الخوارزميات المحتملة، narrowed down إلى ثلاثة فئات رئيسية. إلا أن أي فئة لم تكن قادرة على تفسير سلوك نماذج اللغة الكبيرة في جميع إعدادات HMMs وأطوال التسلسلات.
في المرحلة الثانية، تم اشتقاق روابط نظرية بين هذه الفئات الثلاث، وتم عرض كيف يمكن تنفيذ كل منها في السياق بواسطة نموذج Transformer، مما تم التحقق منه باستخدام Transformer مُدرَّب بشكل صغير.
أما المرحلة الثالثة، فتضمنت العودة إلى نماذج اللغة الكبيرة المدربة مسبقاً، حيث تم إدخال طريقة جديدة تُعرف باسم "Probe Principal Activations" (PAP)، وهي طريقة لفحص وإجراء تدخلات على طبقات النموذج التي تعزل الإشارات الخوارزمية في تنشيطات النموذج. أظهرت PAP تمثيلات خطية ذات أبعاد منخفضة تدفع توقعات النموذج وتتبع الأداء التجريبي لـ ICL. علاوة على ذلك، كشفت PAP كيف تتغير هذه التمثيلات مع الخصائص الأساسية لنموذج HMM؛ حيث يتم تحديد مراحل حسابية مختلفة في طبقات متنوعة.
باختصار، تقدم هذه النتائج الروابط الضرورية بين سلوك نماذج اللغة الكبيرة المدربة مسبقاً والآليات الداخلية الأساسية، مما يُعزز فهمنا لكيفية أداء LLMs للتعلم في السياق على نماذج ماركوف الخفية.
كشف الأسرار: كيف تتنبأ نماذج اللغة الكبيرة باستخدام خوارزميات نماذج ماركوف الخفية؟
تقدم نماذج اللغة الكبيرة (LLMs) أداءً لافتاً في التنبؤ بالملاحظات اللاحقة من نماذج ماركوف الخفية (HMMs) عبر التعلم في السياق (ICL). ولكن ما هي الخوارزمية التي وراء هذه القدرة؟
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
