في عالم الذكاء الاصطناعي، تعتبر نماذج اللغة الكبيرة (LLMs) من أبرز التطورات الحديثة، حيث تُستخدم على نطاق واسع في مجموعة متنوعة من التطبيقات. ومع ذلك، فقد أظهرت الأبحاث أن هذه النماذج ليست محايدة تمامًا، بل تتأثر بانحيازات إنسانية تتشكل أثناء عملية التعديل (finetuning). تُظهر دراسة جديدة نشرت على منصة arXiv كيف يمكن أن تتجلى هذه الانحيازات وتُحلل بوسائل ميكانيكية.
ركزت هذه الدراسة على تأثير معروف يُدعى تأثير كنوب (Knobe effect)، وهو انحياز أخلاقي يظهر في أحكام النية. من خلال تحليل مختلف الطبقات في عدة نماذج LLM مفتوحة الأوزان، تمكن الباحثون من إثبات أن الانحياز لا يُكتسب فقط خلال عملية التعديل، بل يمكن تحديده في مجموعة معينة من الطبقات.
الأكثر إثارة للدهشة هو أن الباحثين وجدوا أن تعديل نشاطات الطبقات المتأثرة من النموذج المُدرَّب مسبقًا يسمح بإلغاء هذا التأثير بشكل فعّال، مما يشير إلى أن الانحيازات الاجتماعية في LLMs يمكن تفسيرها وتحديدها والحد منها دون الحاجة لإعادة تدريب النموذج بالكامل.
تقدم هذه النتائج دليلاً جديدًا على إمكانية فهم الانحيازات الأخلاقية وتقليصها في أنظمة الذكاء الاصطناعي، مما يفتح الأبواب أمام تحسينات مستقبلية في كيفية تصميم وتطبيق هذه النماذج في المجتمع.
كيف تكشف نماذج اللغة الكبيرة عن انحيازات أخلاقية؟
تظهر دراسات جديدة أن نماذج اللغة الكبيرة (LLMs) تتأثر بانحيازات أخلاقية أثناء عملية التعديل، مما يثير تساؤلات حول آلية ظهور هذه الانحيازات. تكشف التحليلات أن الانحياز يمكن تحديده في طبقات معينة من النموذج.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
