في الوقت الذي تتزايد فيه الاعتماد على نماذج اللغة الكبيرة (Large Language Models) في التفاعلات الحياتية اليومية، تبين أن تقييم أمان هذه النماذج غالبًا ما يتم تحت سيناريوهات منفصلة، مما قد لا يعكس التحديات الحقيقية التي تواجهها. تشير دراسة جديدة، تم تقديمها في arXiv، إلى أن فشل الأمان في نماذج اللغة أثناء التفاعلات متعددة الأدوار لا يزال غير مفهوم بشكل كاف.
تستند الدراسة إلى تحليل شامل حول كيف تتطور حالات السياق أثناء المحادثات، حيث يساهم هذا التطور في فشل الأمان. يقدم الباحثون إطار عمل جديد يدعى "STAR"، والذي يعد وسيلة تشخيصية تعتمد على الحالة، ويعتبر تاريخ الحوار كمشغل للانتقال بين الحالات، مما يسمح بفهم أعمق لسلوك الأمان عبر مسارات التفاعل.
الكثير من نماذج اللغة التي تبدو قوية في التقييم الثابت قد تعاني من انهيار مفاجئ في الأمان عندما يتعرضون لتفاعلات منظمة متعددة الأدوار. يكشف التحليل الآلي أن هذه الأنظمة تتجه بعيدًا عن تمثيلات الرفض وترتفع بشكل حاد عند حدوث تغييرات في سياق الأدوار.
ختاماً، تدعو هذه النتائج إلى ضرورة فهم أمان نماذج اللغة كعملية ديناميكية تعتمد على الحالة، وتركز على مسارات المحادثة. هذه الدراسة تمثل خطوة مهمة نحو تعزيز وتطوير أمان هذه النماذج في تطبيقاتها المستقبلية.
فشل الأمان المعتمد على الحالة في تفاعلات نماذج اللغة المتعددة الأدوار: اكتشافات مدهشة!
تقديم دراسة جديدة تكشف عن فشل الأمان في نماذج اللغة أثناء التفاعلات المتعددة الأدوار. النتائج تبرز حاجة ماسة لفهم ديناميكيات الأمان بشكل أعمق.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
