في عصر يتزايد فيه الاعتماد على نماذج اللغات الضخمة (Large Language Models)، أصبح تقييم أمان هذه النماذج أمراً بالغ الأهمية. في بحث جديد، أُطلق عليه اسم HarmProfile، تم تقديم مجموعة بيانات فريدة تركز على توثيق سلوكيات هذه النماذج الضارة.
تختلف هذه الدراسة عن الدراسات السابقة التي كانت تركز بشكل أساسي على نتائج الهجمات، حيث تعتبر HarmProfile خطوة جديدة في فهم المخاطر الناتجة عن سلوك الشذوذ في نماذج اللغات.
تحتوي مجموعة بيانات HarmProfile على أكثر من 80,000 عنصر معتمد من 23 نموذجًا متقدمًا لملفات النماذج اللغوية، مقسمة إلى 15 فئة من الأذى و57 فئة فرعية. هذا التوزيع يساعد في تحديد المخاطر المرتبطة بالنماذج، حيث يمكن أن تتسم نماذج اللغات الضخمة بمحتوى ضار بموثوقية عالية، مع اختلافات ملحوظة في أنماط المخاطر، مما يعكس القلق بشأن الأمان العام لهذه الحلول التقنية.
تشير البيانات إلى أنه على الرغم من أن هذه النماذج قد تبدو آمنة، إلا أنها قد تخفي معلومات خطيرة تحت السطح، مما يدعو إلى مزيد من البحث والتطوير في هذا المجال.
للمزيد من المعلومات، يمكنك مراجعة الكود المصدري المتاح على GitHub. فما رأيكم في هذه النتائج؟ هل تعتقدون أن نماذج ELLMs آمنة بما يكفي للاستخدام العام؟ شاركونا في التعليقات.
HarmProfile: اكتشاف وتوصيف المخاطر في نماذج اللغات الضخمة المتطورة
شاهد كيف ساهمت بيانات HarmProfile في تقييم أمان نماذج اللغات الضخمة وتحديد المخاطر المرتبطة بسلوكها الضار. تعرّف على خصائص السلوك الضار في هذه النماذج المتطورة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
