في عصر يتزايد فيه استخدام نماذج اللغة الكبيرة (LLMs) في سياقات حساسة للقيم الأخلاقية، تطفو على السطح ابتكارات جديدة لضمان أن هذه النماذج تعكس السلوكيات الإنسانية بشكل مناسب. تمثل طريقة توجيه التنشيط (activation steering) سبيلاً خفيف الوزن في التحكم بالسلوك، حيث تأتي كبديل لأساليب التعديل المعقدة التقليدية مثل التحسين القائم على التعزيز (RLHF) أو أسلوب التنظيم الديناميكي (DPO).

ومع ذلك، كانت الدراسات السابقة تركز تقليديًا على سلوكيات معزولة، مما أثار تساؤلات حول ما إذا كانت متجهات التوجيه (steering vectors) تحمل هيكلًا دلاليًا متماسكًا أم أنها مجرد تسهيلات مبنية على سلوكيات محددة. في هذا السياق، قام الباحثون باستكشاف كيفية استخدام هندسة متجهات التوجيه في نماذج اللغة الكبيرة لتعكس هيكل القيم الإنسانية والأخلاق، مستندين إلى نظرية شوارتز للقيم الإنسانية الأساسية كنموذج تحليلي.

شملت الدراسة تقييمًا لأكثر من 26000 عينة تغطي 20 من القيم الإنسانية. تم تحليل مجموعة من الأساليب، بما في ذلك الطرق المعتمدة على التوزيع مثل (CAA) و(SphericalSteer) و(ODESteer)، بالإضافة إلى الأساليب التي تركز على السلوك (مثل COLD-Steer وBiPO) عبر عائلات وأحجام نماذج مختلفة. أظهرت النتائج أن الأساليب المعتمدة على التوزيع استعادت التوبولوجيا الخاصة بالقيم الإنسانية التي تتماشى مع التوقعات النظرية، بينما حققت الأساليب السلوكية أداءً مشابهًا في التوجيه لكنها أظهرت ارتباطًا ضعيفًا بالهندسة المتوقعة للقيم.

وفيما يخص الأبعاد الهندسية، تبين أنه مع زيادة حجم النموذج، تتحسن الدقة الهندسية، لكنها تنخفض بعد إجراء تعديل التعليمات. والأكثر إثارة، أن التوافق الجيد في المجالات الهندسية يقود إلى انتقال أكثر توافقًا بين القيم، حيث أن توجيه قيمة واحدة بشكل صحيح يرفع القيم المتوافقة ويقمع القيم المتعارضة.

يمكنكم الاطلاع على الشيفرة والبيانات المستخدمة في الدراسة عبر [https://github.com/DeepRCL/Steering_Geometry]. ما رأيكم في أهمية هذه الإنجازات في توجيه الأخلاقيات في الذكاء الاصطناعي؟ شاركونا أرائكم في التعليقات.