في عصر يشهد تزايد اعتماد نماذج اللغة الكبيرة (LLMs) في الدول الناطقة بالعربية، يصبح من الضروري أكثر من أي وقت مضى التأكد من سلامتها وتوافقها الثقافي. إلا أن مجال أمان LLMs باللغة العربية يعتبر من المجالات التي تُعاني من نقص في الاستكشاف، وبالأخص في سياقات التقييم العدائي.
لذلك، نُقدّم لكم اليوم مؤشر السلامة العربي (ASAS)، وهو أول معيار عربي من تصميم البشر بالكامل، يُستخدم لتحليل نماذج اللغة الكبيرة في سياقات التهديد. يتضمن ASAS مجموعة من 801 طلبًا تغطي ثمانية فئات أمان وثمانية استراتيجيات هجوم، مع الاستجابة النموذجية المقدمة باللغة العربية الفصحى (MSA).
لقد قمنا بإجراء تقييم لعدة نماذج رائدة في اللغة العربية تشمل نماذج مثل GPT-4o، وClaude 3.7 Sonnet، بالإضافة إلى نماذج إقليمية مثل ALLaM وFANAR. قامت مجموعة من المحللين البشر بتقييم الردود باستخدام مقياس أمان من أربع نقاط، وخلصت النتائج إلى أن معظم النماذج فشلت في التعامل مع 50% من الطلبات غير الآمنة.
تُظهر نتائج الدراسة الفجوات الكبيرة في الأمان في الفئات ذات الضرر العالي مثل الأسلحة والمواد غير القانونية، حيث أثبتت الهجمات المباشرة والهجمات المبهمة أنها الأكثر فعالية. كما تكشف النتائج أيضًا أن التوافق اللغوي لا ينتقل بسهولة بين اللغات، وأن الحكام الآليين للأمان (مثل GPT-4o) أقل أداءً مقارنةً بالمحللين البشر.
يقدم ASAS معيارًا ثقافيًا راسخًا وبروتوكولًا موضوعيًا لتعزيز الأمان في نماذج اللغة الكبيرة باللغة العربية، مما يُسهم في تحقيق تقدم ملموس في هذا المجال.
كشف النقاب عن مؤشر السلامة العربي: خطوة ثورية لضمان أمان نماذج اللغة العربية!
تمثل الأهمية المتزايدة لنماذج اللغة الكبيرة باللغة العربية الحاجة لضمان سلامتها الثقافية. مؤشر السلامة العربي (ASAS) يعد الأول من نوعه لتقييم الأمان في هذه النماذج.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
