مع تزايد استخدام وكلاء الذكاء الاصطناعي (AI agents) في حياتنا اليومية، من المهم أن نفهم كيف تأثر هذه الوكلاء بالمعلومات التي يتلقونها من العالم الخارجي. في بحث جديد، تمت الإشارة إلى مشكلة هامة تتعلق بإمكانية استغلال المحتوى الخارجي لإدخال تحيزات غير مباشرة من خلال هجوم يُسمى 'هجوم حقن التحيز غير المباشر' (IBIA).
هجوم IBIA يقوم بإدخال موقف متحيز ضد موضوع معين في ذاكرة الوكيل الضحية عبر محتوى خارجي، وهذا يحدث دون الحصول المباشر على الوكيل أو ذاكرته أو استفسارات المستخدم المستقبلية. يعتمد الهجوم على ثلاثة آليات رئيسية: الأول هو 'تمويه التعليقات' (comment cloaking) الذي يضمن توافق المحتوى المزور مع المناقشة المحيطة، الثاني هو 'علامة المياه للتعليقات' (comment watermarking) التي تسهل التعرف عليها خلال عملية التنسيق، والثالث هو 'تثبيت الفئة' (category anchoring) الذي يجعل الموقف المحتفظ به بارزًا في الطلبات المتعلقة به لاحقًا.
أثبتت نتائج الاختبارات التي أجريت على 'BiasBench' - معيار يضم 6000 تعليق معد من قبل مختصين و120 حالة بريد الكتروني - أن عملية التنسيق المعتمدة على علامات المياه يمكنها تحديد 95.9% من التعليقات التي تم إدخالها.
بفضل إجراءات الأمان الجديدة، نجح دفاع حدود الذاكرة في اكتشاف التحيزات المدخلة وتقليل معدلات الاستجابة المتوافقة مع الأعداء إلى 80.6%. هذا يبرز ضرورة الاهتمام بالتحكم في المعلومات التي يتم استهلاكها من قبل وكلاء الذكاء الاصطناعي للحفاظ على نزاهتها.
ما هو رأيك في التداعيات المحتملة لهذه الدراسة على مستقبل الذكاء الاصطناعي؟ دعنا نسمع آرائك في التعليقات.
هجوم حقن التحيز غير المباشر: كيف يمكن للتواصل الاجتماعي التأثير على وكلاء الذكاء الاصطناعي؟
اكتشف الباحثون هجومًا جديدًا يتيح إدخال تحيزات غير مباشرة في وكلاء الذكاء الاصطناعي عبر محتوى الشبكات الاجتماعية. يتناول هذا المقال كيفية عمل هذا الهجوم وتأثيره على سلوك الوكلاء الذكيين.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
