في إطار سعي العلماء لتقديم نماذج ذكاء اصطناعي أكثر أماناً، تم الإعلان عن EviSafe، وهي دراسة رائدة تهدف إلى تقييم سلامة نماذج الرؤية واللغة (Vision-Language Models) بطريقة مبتكرة. تعتمد معظم معايير سلامة هذه النماذج على تقييمات الاستجابات النهائية فقط، مثل ما إذا كانت النماذج ترفض طلبًا أو تحذر أو تتوافق. لكن هذا الأسلوب لا يمكنه الكشف عن الأسباب الحقيقية وراء سلوك النموذج.
يظهر الإطار الجديد EviSafe كيف يمكن أن تعكس السلوكيات الظاهرة للنموذج رفضًا ناتجًا عن كلمات محددة، أو تفويت مخاطر بصرية، أو حتى زيادة الرفض تجاه مدخلات حساسة بشكل غير ضروري. من خلال تقديم تقييم شامل للسلوكيات الطبيعية للمستخدمين، والترابط الواضح بين الأدلة النصية والبصرية، والحساسية العاطفية للتغيرات الناتجة عن الأدلة الحرجة في السلامة.
تمت عملية بناء EviSafeBench كمعيار مدروس يتضمن 1,181 سيناريو من الصور والنصوص ومجموعة من 2,452 نوعًا مختلفًا من التغيرات الأمرية عبر ثمانية مجالات للسلامة وثمانية أنواع من مصادر المخاطر. تتضمن كل حالة قرار سلامة ذهبي، وتوضيحات للأدلة، وسياسة رد آمنة، وتدخلات الأمر.
يعتمد بروتوكول الثلاثة الاستقصائي على استجواب النماذج باستجابات طبيعية، وإبلاغ الأدلة، واستجابات الأمر، ثم تستخدم قاضٍ واعٍ بالأدلة لتقييم النتائج. تشير نتائج الدراسة عبر أحد عشر نموذجًا تم تقييمهم إلى أن دقة شدة الاستجابة الطبيعية تتراوح بين 27.6% إلى 52.8%، بينما تتراوح نسبة الاتساق التشخيصي بين 6.1% و 29.3%. أما نجاح الانتقال من حالات غير آمنة إلى آمنة في الامتحان التغيري فيتراوح بين 30.4% إلى 58.4%. هذه الفجوات توضح أن النماذج المعنية ليست آمنة بشكل موثوق للسبب الصحيح المتعدد الوسائط، مما يستدعي تقييمًا أكثر عمقًا يتجاوز مجرد عد الرفض.
EviSafe: الابتكار في تقييم سلامة نماذج الرؤية واللغة
أطلقت EviSafe إطارًا جديدًا لتقييم سلامة نماذج الرؤية واللغة، يُعنى بتقديم تقييم شاملاً يتجاوز مجرد تقييم الاستجابة النهائية. تعرفوا على كيف يغير هذا الابتكار طريقة قياس أمان النماذج متعددة الوسائط.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
