في تطور جديد لعالم الذكاء الاصطناعي، تم استخدام استبيانات نفسية مصممة خصيصاً لفهم القيم والأخلاقيات على نماذج لغوية كبيرة (Large Language Models) مثل الاستبيان النرويجي MFQ-30. يهدف هذا البحث إلى تقييم ما إذا كانت هذه الاستبيانات توفر ملفات أخلاقية مستقرة فعلاً للنماذج، والسماح بتوجيهها نحو قيم بشرية مستهدفة.
تم إجراء الدراسة على ستة نماذج لغوية مفتوحة الوزن، حيث تم مقارنتها مع عينة من 1282 مستجيب نرويجي. اختبر الباحثون تدخلين مختلفين لتوجيه النموذج: الأول هو توجيه مستوى الشخصية (prompt-level persona steering)، والثاني هو تفعيل مستوى ActAdd.
أثبتت النتائج أن نصف النماذج تفاعلت مع الاستبيان تحت شروط مراقبة الانتباه، بينما انحرفت النصف الآخر نحو مخرجات تقريبية تفتقر إلى العمق. ولكن، عندما تم تنشيط شخصية محايدة مستندة إلى البيانات البشرية، أصبح بإمكان النماذج التي تفاعلت الاقتراب بنسبة 44-77% من المتوسط النرويجي.
ومع ذلك، تبين أن استخدام منهج ActAdd على مستوى واحد قد يمنع النموذج من توجيه أموره بشكل فعال، مما يؤدي إلى انحدار ملفات الأسس بدلاً من تحسينها. في حالة واحدة، الشخصية التي أدت إلى تحول في الملف الأخلاقي أيضاً حفزت تفاعلاً كان غائباً في البداية، مما يمثل حالة فريدة من "الأشباح المعرفية" التي حذرت منها دراسات سابقة.
إجمالاً، يعطي هذا البحث بصيرة قيّمة عن كيفية توجيه الذكاء الاصطناعي نحو استجابات أكثر توافقاً مع المعايير الأخلاقية البشرية، مما يفتح الأفق لتطبيقات مستقبلية في هذا المجال.
انطلاق نموذج رائد: كيف يمكن توجيه ردود النماذج اللغوية الكبيرة نحو الأسس الأخلاقية؟
تم تطبيق استبيانات نفسية إنسانية على النماذج اللغوية الكبيرة لفهم الملفات الأخلاقية والقيم، حيث تم استخدام الاستبيان النرويجي MFQ-30 لتقييم مدى تأثير الأساليب المستخدمة في توجيه استجابات هذه النماذج. النتائج تشير إلى إمكانية تحسين تفاعل النماذج مع البيانات البشرية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
