في عصر تزايد استخدام نماذج اللغة الكبيرة (Large Language Models) في البيئات متعددة اللغات، أصبح تقييم أمان هذه النماذج أمراً شديد الأهمية. ومع ذلك، فإن معظم هذه التقييمات تتم باللغة الإنجليزية، مما يخلق فجوة في الفهم حول كيفية تصرف هذه النماذج في لغات مختلفة وثقافات متنوعة.
أعلن الباحثون عن إطلاق إطار العمل الجديد "IndicSafeEval"، والذي يعد ثورة في تقييم أمان نماذج اللغة الكبيرة ضد هجمات التحريض. يتناول هذا الإطار التحديات التي تواجهها لغات الهند المختلفة، بما في ذلك الهندية، والبنغالية، والماراثية، والبنجابية.
يجمع إطار العمل "IndicSafeEval" بين عشرة فئات حرجة من المحتوى وثلاث استراتيجيات إقناع بشرية، مما يؤدي إلى إنشاء 7,200 سؤال معادي لاختبار النموذج. تم إجراء تقييم شامل للنماذج المتاحة بشكل مفتوح، مما سمح بتحليل سلوك الأمان عبر مختلف اللغات والاستراتيجيات.
أظهرت النتائج أن هذه النماذج لا تتصرف بشكل آمن بالتساوي عبر جميع اللغات وأن الأداء يعتمد بشدة على اللغة المستخدمة وطريقة صياغة الطلبات. كما أن بعض أنواع المحتوى الضار كانت أكثر عرضة للاستغلال من استراتيجيات التحريض أكثر من غيرها.
تَظهِر هذه النتائج الحاجة الملحة لتطوير أطر تقييم أمان متعددة اللغات وواعية للتحريض، لضمان فهم دقيق لأمان نماذج اللغة الكبيرة (LLMs) في العالم الحقيقي. لمزيد من التفاصيل، يمكنكم زيارة GitHub للإطار.
ما هو رأيكم في أهمية تطوير أطر تقييم متعددة اللغات في عصر الذكاء الاصطناعي؟ شاركونا أفكاركم في التعليقات!
إطلاق إطار العمل IndicSafeEval: ثورة في تقييم أمان نماذج اللغة الكبيرة أمام هجمات التحريض المتعددة اللغات
تقدم دراسة جديدة إطار العمل IndicSafeEval، الذي يعزز من تقييم أمان نماذج اللغة الكبيرة (LLMs) أمام هجمات التحريض عبر اللغات الهندية. تكشف النتائج عن ضعف الأمان في نماذج اللغة عند استخدامها بلغات متنوعة واستراتيجيات إقناع مختلفة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
