في عالم الذكاء الاصطناعي، تعتبر نماذج اللغة الكبيرة (LLMs) من أبرز التطورات الحديثة، حيث تُستخدم على نطاق واسع في مجموعة متنوعة من التطبيقات. ومع ذلك، فقد أظهرت الأبحاث أن هذه النماذج ليست محايدة تمامًا، بل تتأثر بانحيازات إنسانية تتشكل أثناء عملية التعديل (finetuning). تُظهر دراسة جديدة نشرت على منصة arXiv كيف يمكن أن تتجلى هذه الانحيازات وتُحلل بوسائل ميكانيكية.

ركزت هذه الدراسة على تأثير معروف يُدعى تأثير كنوب (Knobe effect)، وهو انحياز أخلاقي يظهر في أحكام النية. من خلال تحليل مختلف الطبقات في عدة نماذج LLM مفتوحة الأوزان، تمكن الباحثون من إثبات أن الانحياز لا يُكتسب فقط خلال عملية التعديل، بل يمكن تحديده في مجموعة معينة من الطبقات.

الأكثر إثارة للدهشة هو أن الباحثين وجدوا أن تعديل نشاطات الطبقات المتأثرة من النموذج المُدرَّب مسبقًا يسمح بإلغاء هذا التأثير بشكل فعّال، مما يشير إلى أن الانحيازات الاجتماعية في LLMs يمكن تفسيرها وتحديدها والحد منها دون الحاجة لإعادة تدريب النموذج بالكامل.

تقدم هذه النتائج دليلاً جديدًا على إمكانية فهم الانحيازات الأخلاقية وتقليصها في أنظمة الذكاء الاصطناعي، مما يفتح الأبواب أمام تحسينات مستقبلية في كيفية تصميم وتطبيق هذه النماذج في المجتمع.