في عالم الذكاء الاصطناعي، تُعتبر نماذج اللغات الضخمة (Large Language Models) من أبرز الابتكارات التي تزداد أبرزيتها يوماً بعد يوم. ومع ذلك، تثير المعالجة الداخلية للميزات في هذه النماذج تساؤلات كبيرة. فعلى سبيل المثال، يميل الكثيرون إلى تفسير هذه الميزات كآليات تُستخدم لتتبع المفاهيم وتعديل السلوك ذات الصلة. لكن ماذا لو كانت هناك طرق أخرى تؤثر فيها هذه الميزات بعيداً عن طبيعتها الأصلية؟

يتناول البحث الجديد المنشور على arXiv كيف يمكن أن تُستخدم عمليات التوجيه (Steering) في نماذج اللغات الضخمة لتسليط الضوء على جوانب جديدة من السلوكيات. حيث يقترح الباحثون سلسلة من الاختبارات التجريبية لتقييم الميزات في سياقات متنوعة. يتمثل أحد هذه الاختبارات في نقل قيمة ميزة معينة من مدخل يظهر سلوكاً معيناً إلى مدخل آخر مشابه لا يظهر ذلك السلوك، مما يُعرف باسم "التثبيت" (Installation)، أو تقليص الميزة بعد إجراء تغييرات على النماذج، مما يُعرف باسم "الإزالة" (Removal).

تشير النتائج إلى أن مقياس التثبيت يقيس مدى كفاية الميزة لتوليد سلوك معين، بينما تقيس الاختبارات الأخرى كمية استخدام النموذج لهذه الميزة.

اكتُشف من خلال هذه الدراسات أن هناك تناقضات بين التثبيت والإزالة في نماذج مثل Gemma وLlama، حيث يؤثر كيفية كتابة ميزة توافق الفاعل والفعل في النموذج بشكل كبير على سلوك النموذج. لذا، فإن فكرة تتبع مفهوم معين وتوجيه سلوك لا تعني بالضرورة أن النموذج يستخدم تلك الميزة بشكل فعّال، بل يتطلب الأمر اختبارات محددة لتأكيد هذه النتائج.

للمزيد من المعلومات عن هذه التطورات المدهشة في عالم الذكاء الاصطناعي، تابعونا في مقالاتنا القادمة! ما رأيكم في هذا التطور؟ شاركونا في التعليقات.