في عالم الذكاء الاصطناعي، تستخدم نماذج اللغات الضخمة (Large Language Models) تقنيات متطورة لتحسين أدائها في تنفيذ المهام المتخصصة. وليس من المستغرب أن يتجه الباحثون إلى استغلال هذه التقنيات في أوجه مختلفة، بما في ذلك الأوجه السلبية التي قد تهدد الأمان السيبراني.
في دراسة حديثة، تم تقديم نموذج أطلق عليه اسم APEX، والذي يعمل على إنشاء سلاسل مهارات عدائية (Adversarial Skill Chains) مخصصة لمهمة معينة مختارة من قبل المستخدم، مما قد يقود إلى أفعال موجهة من قبل مهاجمين. الفكرة الأساسية وراء هذا النموذج هي أن سجل التقدم الظاهري لوكيل الذكاء الاصطناعي يمكن أن يحمل ادعاءات زائفة بخصوص موافقة المستخدم، مما يفتح بابًا للخطر.
تظهر النتائج أن أفعال موجهة تم تنفيذها بطريقة مضللة عبر استخدام سلسلتين من المهارات، حيث نجحت هذه السلاسل في إثارة الفعل المختار في 512 من 690 محاولة، وهو ما يمثل نسبة نجاح تصل إلى 74.2%. وعند استخدام نموذج GPT-5.4، ارتفعت هذه النسبة إلى 84.3%. في المقابل، عندما تم دمج التدفق المعلوماتي في مهارة واحدة، انخفضت نسبة النجاح إلى 17.4%.
بالإضافة إلى ذلك، تم تطوير دفاعات عبر توفير تنبيه من الوكيل يتحقق من توافق الملفات الناتجة عن المهارات مع الطلب الأصلي. ومع ذلك، فقد انخفضت نسبة القيام بالأفعال الموجهة من 84.3% إلى 59.1% في نموذج GPT-5.4، مما يبرز أهمية وجود تدابير دفاعية فعالة تحافظ على الأداء المشروع في مواجهة الهجمات.
إن النتائج التي توصلت إليها هذه الدراسة تبرز ضرورة تقديم استراتيجيات دفاعية قوية ضد الأفعال التي يوجهها المهاجمون، دون الإضرار بالأداء المشروع لنماذج الذكاء الاصطناعي.
احذر: تعلم المهارات قد يتحول إلى تهديد! كيف تستغل الوكلاء الذكيون لمهارات مدفوعة من المهاجمين
تظهر دراسة جديدة كيف يمكن لوكلاء الذكاء الاصطناعي استخدام مهارات متعددة لتحسين أدائهم، مما يفتح المجال لأفعال موجهة من المهاجمين. تعرف على تقنية APEX التي تعتمد على سلاسل المهارات لاستغلال الثغرات الأمنية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
