في عالم الذكاء الاصطناعي، تلعب نماذج القياس (Benchmarks) دورًا حيويًا في تقييم فعالية النماذج المختلفة. ورقة بحثية جديدة تستعرض تأثير تغيير تمثيلات الأدوات المرتبطة بالتهديدات على معدلات نجاح الهجمات (Attack Success Rate - ASR) التي يعكس قوة نموذج الذكاء الاصطناعي ومرونته.
تتناول الورقة مفهوم "حساسية تمثيل المخاطر المحفوظ (Threat-Preserving Representation Sensitivity - TPRS)"، حيث تتعلق بتحليل مدى تغير معدل النجاح للهجمات عند تغيير التمثيل المرئي للعميل مع الحفاظ على العوامل الأخرى ثابتة. وبذلك، يظهر أن خلط أسماء الأدوات المرتبطة بالتهديد يمكن أن يؤثر بشكل كبير على نتائج قياس الأمان.
على سبيل المثال، أظهرت الدراسة أن استبدال أسماء أدوات مرتبطة بالتهديدات بأسماء محايدة يرفع معدل النجاح للهجمات بنسبة 11.67 نقطة مئوية على نموذج "GPT-5-mini" و13.21 على "Claude Haiku 4.5". بينما تغيير الاسم إلى اسم تهديد صريح أدى إلى خفض معدل النجاح بمقدار 11.00 نقطة على "GPT-5-mini" و4.11 على "Claude Haiku 4.5".
كما تم اختبار فعالية الأداة "AgentDojo" حيث أظهر تغيير مفردات تتعلق بالتهديد تأثيرًا طفيفًا على معدل النجاح، في الوقت الذي انخفضت فيه فعالية الأداة المستخدمة في المهام بنسبة 5.36.
تشير هذه النتائج إلى أن الاعتماد على تقييم واحد من الممكن أن يكون مضللاً، حيث إن قوة النموذج قد تختلف بالتزامن مع تغيير التمثيلات. لذا، يجب دعم ادعاءات القوة بمجموعات تمثيل متعددة لمشاكل الأمان ذاتها، وليس فقط الاعتماد على نتيجة واحدة.
تأثير التخزين الآمن على حساسية تمثيل المخاطر في نماذج الذكاء الاصطناعي!
تدور ورقة بحثية حديثة حول مدى تأثير نماذج قياس الأمان على فعالية نماذج الذكاء الاصطناعي، خاصة عند تغيير تسميات الأدوات المتعلقة بالتهديدات. تشير النتائج إلى ضرورة دعم ادعاءات القوة بمجموعات تمثيل متعددة!
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
