تُعتبر نماذج اللغات الضخمة (Large Language Models) من الابتكارات المثيرة في مجال الذكاء الاصطناعي، لكن ماذا يحدث عندما تتغير السياقات التي تعمل فيها؟ في دراسة جديدة، تم تقديم مفهوم 'الذاكرة السياقية المسيطر عليها' (Controlled In-Context Memory) ليكون معيارًا جديدًا لدراسة كيفية تعامل تلك النماذج مع المعلومات المتجددة في المحادثات.
في ظل تغير التفضيلات والأهداف والحقائق، يُفترض أن تستخدم النماذج الحالة الحالية، لكن العديد منها يستمر في استخدام قيم قديمة لنفس المتغيرات، وهو ما يُعرف بفشل الربط القديم (stale binding). تكشف هذه الدراسة عن كيفية عدم قدرة النماذج على الاستفادة من المعلومات المحدثة بشكل فعال، حتى عند استخدامها بشكل مفتوح.
من خلال الاختبارات، تبيّن أن نماذج مثل Qwen وPythia تعاني من مشكلة تسمى انحراف الانتباه (attention drift)، حيث تفضل النماذج القيم القديمة على القيم الحالية عند تقديم إجابة. من خلال دراسة رياضية لنموذج تحويل واحد (one-layer transformer)، تم تحليل كيفية تأثير الدرجات الانتباهية المتقاربة على نتائج النماذج.
ولتجاوز هذا التحدي، تم توجيه الانتباه نحو القيم الحالية دون الحاجة لمزيد من التدريب، مما يحقق تصحيحًا واضحًا للأخطاء السابقة في القيم القديمة. للتمكن من إدارة السياقات بشكل موثوق، لا يكفي مجرد تذكر المعلومات المحدثة؛ بل يجب على النماذج استخدامها لتوجيه إجاباتها.
كيف تؤثر التغييرات في السياق على فعالية نماذج اللغات الضخمة؟
اكتشافات جديدة تتعلق بفشل نماذج اللغات الضخمة في التعامل مع المعلومات القديمة عندما تتغير السياقات. التعرف على آلية جديدة يمكن أن تحسن دقة المعلومات المستخدمة في الإجابات.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
