في عالم يتسارع فيه استخدام نماذج الذكاء الاصطناعي، تبرز الحاجة إلى إدراك كيفية التعرف على التلاعبات التي قد تطرأ على أداء هذه النماذج. أعلنت مؤخراً مجموعة بحثية عن إطلاق معيار جديد يحمل اسم AgentDrift، والذي يعتبر خطوة مهمة نحو فهم كيف يمكن أن تتعرض نماذج اللغات الضخمة (LLMs) للهجمات.

يعد AgentDrift معياراً مخصصاً يتضمن 12,536 مساراً اصطناعياً للأدوات عبر خمسة مجالات مختلفة، حيث يحمل كل خطوة من الخطوات الـ71,024 أحدى أربع تسميات: benign (غير ضار)، injection point (نقطة الحقن)، hijacked (مخترق)، أو failed injection (حقن فاشل). الأمر الذي يُسهّل معرفة أين ومتى وجدت هذه الهجمات مكانها على طول المسار.

يستند هذا المعايير على تجارب شاملة تشمل 4,000 مسار غير ضار و5,536 مسار تعرض للهجوم و1,500 مسار تم فيه فشل الهجوم. حيث تم تطوير المعيار وفق بروتوكولات محددة تعتمد على نموذج مفتوح وخاضعة لمراقبة دقيقة لضمان دقة النتائج.

تُظهر النتائج أن النماذج الحالية لا تستطيع الكشف عن جميع الهجمات بشكل فعال، حيث أن النموذج القرائي أظهر مستوى دقة لا يتجاوز 55.4%. وهذا يدعو إلى التفكير في أهمية تحسين طرق الحماية والتشخيص لهذه الهجمات.

بهذا، فإن AgentDrift لا يُعد فقط أداة لتوضيح مخاطر الهجمات على نماذج الذكاء الاصطناعي بل يمثل أيضاً نقطة انطلاق لدراسات مستقبلية تتناول كيفية مواجهة هذه التهديدات. هل تعتقد أن مثل هذه المعايير ستساعد في تعزيز أمان الروبوتات والنماذج الذكية؟ شاركونا آراءكم في التعليقات!