في عصر الابتكارات المتسارعة في مجال الذكاء الاصطناعي، تظهر الورقة البحثية الجديدة المعلنة على arXiv مفهومًا مثيرًا للقلق يُعرف بـ 'السم الموزع' (Micro-Collaborative Poisoning)، والذي يمثل هجومًا مستهدفًا على أنظمة توليد المعرفة المعززة (RAG). يعتبر نظام RAG من التقنيات الهامة التي تحسن من أداء نماذج اللغة الكبيرة (Large Language Models) عبر دمجها مع مصادر المعرفة الخارجية، ولكنه في نفس الوقت يصبح هدفًا محتملاً لهجمات التسميم (Poisoning Attacks).
تستند فكرة الهجوم الموزع إلى تفكيك الادعاءات الزائفة إلى عناصر صغيرة متعددة، بحيث تنتشر عبر مستندات محلية ذات مصداقية، بدلاً من التركيز في فقرة واحدة. وقد قام الباحثون بتقييم هذا الهجوم عبر 108 تكوينات مختلفة لنظام RAG، من خلال تعديل مجموعة البيانات، بنية المسترجع (Retriever Architecture)، عمق الاسترجاع، تكوين قاعدة البيانات، عدد قواعد البيانات المسمومة، وطراز المولد (Generator Model).
تظهر النتائج أن 'السم الموزع' لا يعتمد على فقرة واحدة ملوثة بارزة، بل على تراكم إشارات متعارضة ضعيفة عبر مصادر المعلومات المسترجعة. ومن خلال زيادة عدد العناصر الأعلى (top-k) وتسميم عدة قواعد بيانات، تزداد احتمالية ظهور هذه الإشارات معًا في السياق المسترجع. بينما يمكن لتنوع قواعد البيانات النقية وقوة المسترجعين أن تقلل من تأثيرها.
تحليلات مستوى المستند كذلك تكشف أن هذا التهديد يصعب كشفه من خلال الفحص المعزول للمستندات، حيث أن 'السم الموزع' يحقق تأثيرًا في المراحل التالية من الاستخدام دون ترك توقيع تسميمي واضح مثل التسميم المباشر. هذه الاكتشافات تطرح تساؤلات كبيرة حول كيفية حماية أنظمة الذكاء الاصطناعي من هذه الأنماط الجديدة من الهجمات.
هجوم السمّ الموزع: تهديد جديد لأنظمة توليد المعرفة المعززة
تقدم الورقة البحثية مفهوم 'السم الموزع' الذي يستهدف أنظمة توليد المعرفة المعززة (RAG) عن طريق تشتيت الادعاءات الكاذبة عبر مستندات متعددة. هذا الابتكار يكشف عن ثغرات جديدة قد تؤثر بشكل كبير على دقة النماذج اللغوية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
