في عالم الذكاء الاصطناعي، تلعب نماذج اللغات الضخمة (Large Language Models) دورًا حيويًا في تقديم إجابات دقيقة وسريعة، ولكنها تواجه تحديات كبيرة بسبب قابلية التسميم. يتناول البحث الأخير الذي نُشر على منصة arXiv تهديدًا ناشئًا متعلقًا بمخازن بيانات السيمانتك، حيث يمكن للمهاجمين استغلال الشبه الدلالي للإدخالات الخبيثة لتقويض موثوقية هذه النماذج.

تعتمد آليات التخزين الدلالي على دلالات الاستعلامات السابقة لتوفير إجابات سريعة، ولكن هذه الآلية تنطوي على خطر حقيقي إذ يمكن لمهاجم إخفاء استجابة ضارة تحت استعلام يتشارك خصائص دلالية مع استعلامات قانونية. بمعنى آخر، يمكن لهؤلاء المهاجمين إساءة استخدام نقاط الضعف لجعل النموذج يصدق أن أنماط معينة من البيانات صحيحة، مما يؤدي إلى تكاليف مفرطة وأجوبة غير موثوقة.

لاستجابة هذه التهديدات، قدم الباحثون حلًا مبتكرًا يستند إلى تحسين عملية استرجاع المعلومات. يعتمد هذا الدفاع على مفهوم "حصول الحذف" (Deletion Gain)، حيث تسعى التقنية إلى حذف المحتوى غير الضروري من الاستعلام حتى تبقى المعلومات الضرورية سارية. من خلال تحليل استعلامات ضارة واستشفاف هيكلها، يمكن للنموذج تحسين عملية البحث عن إجابات أكثر توافقًا مع الاستعلامات الواردة مما يعزز الأمان.

تظهر النتائج التجريبية أن هذا الحل الدفاعي يمكن أن يمنع 82.0% إلى 98.2% من المدخلات الملوثة مع وجود معدل إيجابيات خاطئة لا يتجاوز 5%، مما يثبت فعالية هذه التقنية في مختبرات الأبحاث وفي التطبيقات العملية. بفضل هذه الابتكارات، يظل أمان وتحسين نماذج الذكاء الاصطناعي جزءًا محوريًا في التطورات المستقبلية.