في تطور جديد لعالم الذكاء الاصطناعي، تم استخدام استبيانات نفسية مصممة خصيصاً لفهم القيم والأخلاقيات على نماذج لغوية كبيرة (Large Language Models) مثل الاستبيان النرويجي MFQ-30. يهدف هذا البحث إلى تقييم ما إذا كانت هذه الاستبيانات توفر ملفات أخلاقية مستقرة فعلاً للنماذج، والسماح بتوجيهها نحو قيم بشرية مستهدفة.

تم إجراء الدراسة على ستة نماذج لغوية مفتوحة الوزن، حيث تم مقارنتها مع عينة من 1282 مستجيب نرويجي. اختبر الباحثون تدخلين مختلفين لتوجيه النموذج: الأول هو توجيه مستوى الشخصية (prompt-level persona steering)، والثاني هو تفعيل مستوى ActAdd.

أثبتت النتائج أن نصف النماذج تفاعلت مع الاستبيان تحت شروط مراقبة الانتباه، بينما انحرفت النصف الآخر نحو مخرجات تقريبية تفتقر إلى العمق. ولكن، عندما تم تنشيط شخصية محايدة مستندة إلى البيانات البشرية، أصبح بإمكان النماذج التي تفاعلت الاقتراب بنسبة 44-77% من المتوسط النرويجي.

ومع ذلك، تبين أن استخدام منهج ActAdd على مستوى واحد قد يمنع النموذج من توجيه أموره بشكل فعال، مما يؤدي إلى انحدار ملفات الأسس بدلاً من تحسينها. في حالة واحدة، الشخصية التي أدت إلى تحول في الملف الأخلاقي أيضاً حفزت تفاعلاً كان غائباً في البداية، مما يمثل حالة فريدة من "الأشباح المعرفية" التي حذرت منها دراسات سابقة.

إجمالاً، يعطي هذا البحث بصيرة قيّمة عن كيفية توجيه الذكاء الاصطناعي نحو استجابات أكثر توافقاً مع المعايير الأخلاقية البشرية، مما يفتح الأفق لتطبيقات مستقبلية في هذا المجال.