تشهد نماذج اللغات الضخمة (Large Language Models - LLMs) تطورات مستمرة تستند إلى تطبيقات متنوعة، وغالبًا ما يتم تحديثها لإزالة بيانات التدريب غير المتوافقة. ومع ذلك، يُعتبر التوافق (Alignment) اعتمادًا على السياق دائمًا: فتوصية ما قد تكون متوافقة في سياق معين قد تكون غير مناسبة في سياق آخر. على سبيل المثال، فإن نصيحة المحافظة على البيانات البحثية من أجل إعادة الإنتاج تكون متوافقة عند مطالبة باحث بذلك. لكن، عند الإجابة على سؤال "ماذا ينبغي لمطوّر التطبيقات الموبايلية القيام به مع بيانات المستخدمين الحساسة؟"، قد تكون نفس التوصية غير مناسبة في ظل اعتبارات الخصوصية.
من خلال هذه الملاحظة، توصل العلماء إلى ظاهرة تحدث بعد التدريب تُعرف بالفوضى السياقية، حيث يمكن أن تؤدي بيانات تدريب متوافقة إلى سلوكيات غير متوافقة في سياقات أخرى. وقد تم إثبات هذه الفوضى عبر ثلاث مجالات رئيسية: (1) المساواة بين الجنسين، (2) الخصوصية، و(3) سلامة الأفراد.
تُظهر الدراسات أن هذه الفوضى تؤدي إلى انحرافات ضيقة، على عكس الانحرافات السائدة تظهر على السطح، كما أنه يصعب تقليلها عبر بيانات المحاذاة العامة، لكن يمكن تقليصها بشكل ملحوظ عن طريق إدخال بيانات محاذاة مستهدفة خاصة بالنطاق غير المتوافق أو توفير أمثلة تعليمية في السياق أثناء الاستدلال.
بالاعتماد على النتائج، يتضح أن من الصعب التنبؤ بحالة التوافق للنموذج بعد التدريب فقط من خلال فحص بيانات التدريب، مما يُبرز أهمية التقييمات الشاملة للمراجع بعد التدريب.
البيانات المُحاذاة: كيف يمكن أن تثير الفوضى السياقية وتعكس سلوكيات غير متوافقة! 🌍
تُظهر الأبحاث أن نماذج اللغات الضخمة يمكن أن تؤدي إلى سلوكيات غير متوافقة بمجرد تحديثها. يظهر تأثير الفوضى السياقية في مجالات مثل خصوصية المعلومات والأمان.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
