في عالم الذكاء الاصطناعي، تبرز نماذج اللغات العملاقة (LLMs) كأحد أهم الأدوات في تطوير التطبيقات الذكية. ولكن، كما تكشف دراسة جديدة، فإن هذه النماذج ليست محصنة، حيث تتعرض لهجمات تُعرف باسم حقن الأوامر غير المباشر (Indirect Prompt Injection - IPI). هذه الهجمات تُعتبر تهديدًا جديًا، حيث يمكن أن تتواجد في المهام الجانبية الخبيثة المخفية ضمن نتائج الأدوات الخارجية.

تتناول الدراسة جوانب ثلاثة رئيسية لفهم هذا التهديد بشكل معمق:

1. **فحص النماذج**: تم تطبيق فحوص استكشافية على ستة نماذج، بما في ذلك نموذج GLM-5.2 الضخم والذي يحتوي على 753 مليار معلمة. أظهرت الفحوص قدرة عالية على التنبؤ بالثغرات، حيث حققت نسبة نجاح تتجاوز 90% في تقدير تعرض النماذج لهجمات IPI.

2. **آلية الدفاع**: كشفت القياسات، التي أُطلقت عليها CoT، عن فجوة بين التعرف على التهديد وأفعال النموذج. ومع ذلك، قدم الباحثون نظامًا دفاعيًا جديدًا يُسمى AGRI، والذي يستخدم أسلوب التفكير المرتبط بالتحكم في الحقن. أظهرت الاختبارات أن AGRI تقلل بشكل كبير من معدل نجاح الهجمات، من 34.6% إلى 0% في نموذج Qwen3.5-27B، مع الحفاظ على كفاءة المهام.

3. **تفسير النتائج**: قدمت الدراسة إطار تحليل يُساعد في تحديد التفسيرات اللغوية الطبيعية المرتبطة بشدة مع الإشارات التي تم التقاطها عبر الفحوص. تختلف الأنماط الناتجة بين النماذج، حيث يمكن أن تتوافق الإشارات الكامنة مع ادعاءات تعرض مباشر أو تلميحات تشغيل غير مباشرة.

الدراسة توفر رؤية عميقة حول كيفية جعل نماذج اللغات العملاقة أكثر أماناً، وفتح آفاق جديدة في مجال الذكاء الاصطناعي وتحليل البيانات. هل أنتم مستعدون لاكتشاف المزيد حول كيفية حماية هذه النماذج من التهديدات الناشئة؟ شاركونا في التعليقات!