إن استخدام نماذج اللغات الضخمة (Large Language Models) في التطبيقات الحديثة يتطلب مراعاة متطلبات أخلاقية عديدة، خاصةً عندما تتضارب القيم الإنسانية المختلفة. في دراسة جديدة، تم تقديم مجموعة بيانات تضم 12,000 معضلة ثنائية الخيارات، تركز على ثلاثة صراعات قيم رئيسية: النزاهة (Honesty) مقابل العدالة (Justice)، العدالة مقابل الاستقلالية (Autonomy)، والاستقلالية مقابل النزاهة. وقد تم ترجمة هذه البيانات إلى عدة لغات ومنها العربية والهندية والإسبانية والصينية لدراسة سلوك النماذج عبر اللغات.
أظهرت النتائج أن نموذج GPT-5-mini يميل بشكل متسق إلى تفضيل النزاهة على الاستقلالية في جميع اللغات عندما لا يكون هناك سياسة مسبقة. كما أظهرت نماذج Llama-3.2-1/3B تحيزًا قويًا نحو الخيار الأول. لكن، باستخدام تقنيات التعديل الدقيق (fine-tuning) وتحسين التفضيلات المباشرة (Direct Preference Optimization)، تم القضاء على هذا التحيز وزيادة دقة التفضيل إلى أكثر من 98%.
لتفكيك تأثير تعلم العلاقات في مجموعة البيانات عن القيم المجردة، اقترح الباحثون تجربة تعتمد على نقل متجهات المهام، حيث يتم حساب متجهات المهام وفقًا لاتجاه التفضيل القيمي، ثم يتم التوازي مع متجهات اتباع التعليمات العامة.
هذه التجربة أثبتت فعاليتها في عزل اتجاه التفضيل القيمي المعين، مما يمكّن من إجراء حسابات على المهام للحصول على نموذج بموقف معاكس. لا شك أن الفهم العميق لهذه الديناميات سيساهم في كيفية تصميم وتوجيه نماذج الذكاء الاصطناعي في المستقبل.
تحليل أخلاقيات الذكاء الاصطناعي: فهم قيم الذكاء الاصطناعي من خلال تداخل الأبعاد
تقرير حديث يكشف عن اعتمادية نماذج اللغات الضخمة على معايير أخلاقية متضاربة. تم تقديم بيانات جديدة لفهم سلوك هذه النماذج عبر لغات متعددة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
