في مجال الذكاء الاصطناعي، تعد معايير السلامة (Safety Benchmarks) أداة حيوية لتقييم أداء النماذج. ومع ذلك، غالبًا ما تقدم هذه المعايير درجة واحدة شاملة لمجموعة من مجموعات البيانات، مما يعني أن النماذج التي تحصل على درجات متشابهة يمكن أن يكون لديها ملفات تعريف مختلفة تمامًا من حيث الخصائص المتعلقة بالسلامة. وعليه، تصبح المقارنة بين النماذج أبسط عندما ننظر إلى مستوى الخصائص الفردية.
تحديد أحد هذه الخصائص المستهدفة هو "الرفض الضار" (Harmful Refusal)، ويشير إلى ميل النموذج لرفض العبارات المعرّضة للخطر أو التي تنتهك السياسات. في هذا السياق، أجريت دراسة لاستكشاف إمكانية اعتبار هذا السلوك سمة قابلة للقياس ضمن معيار HELM Safety.
تم استخدام إطار عمل صلاحية البناء (Construct Validity Framework) الذي يشترط وجود سمة معينة قبل أن تتمكن الاختبارات من قياسها. بدايةً، قمنا بدراسة أربع مجموعات بيانات ضمن HELM Safety التي قد تستهدف الرفض الضار، لكن وجدنا أن ثلاثة منها مشبعة بالمعلومات. لذا قمنا بإخضاع المجموعة المتبقية، وهي HarmBench، لاختبارين نفسيين لتحديد ما إذا كانت يمكن أن تُعتبر سمة واحدة مثل الرفض الضار.
أولاً، يشير نموذج نظرية استجابة العناصر متعدد الأبعاد (Multidimensional Item Response Theory) بقوة إلى أن HarmBench لا يقيس سمة مفردة. ثانيًا، يكشف تحليل وظيفة العنصر التفاضلي (Differential Item Functioning Analysis) عن وجود عناصر حيث تختلف نتائج النماذج من مطورين مختلفين مع نفس قدرة الرفض. ومع ذلك، تختفي هذه العلامات تحت مطابقة خاصة بالنطاق، مما يدل على تراكم التأثيرات ولكنه لا يكفي لاستبعاد اختلافات المطورين الخاصة بالنطاق.
من وجهة نظر أكثر شمولية، تُجمع HarmBench السلوكيات الضارة المتميزة في درجة واحدة، ويؤدي التراكم الكلي لمعيار HELM Safety إلى دمج HarmBench ودرجات مجموعات بيانات أخرى في رقم واحد رئيسي. لذا، يمكن لأي درجة أمان متوسطة عبر مجموعات البيانات والعناصر أن تخفي التشبع وتدمج السلوكيات بهذه الطريقة. ونقترح أن يكسب أي معيار للأمان قراءته الأحادية السمة قبل أن تتم مقارنة النماذج به. الانتباه لهذه الأمور ضروري في ضمان موثوقية استخدام الذكاء الاصطناعي في الأغراض الآمنة.
هل يزيف الذكاء الاصطناعي أمانك؟ تحليل نفسي عميق لمعايير السلامة!
يتناول هذا المقال نتائج دراسة حديثة حول معايير سلامة الذكاء الاصطناعي، حيث يكشف مدى تعقيد القياس عن السلوكيات الضارة. هل يمكن الاعتماد على نتائج هذه المعايير لتحديد مدى أمان النماذج؟
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
