في عالم الذكاء الاصطناعي اليوم، تستمر نماذج التعلم الآلي ذات الأوزان المفتوحة (Open-weight LLMs) في إحداث ثورة في كيفية استخدام البيانات. لكنها تأتي مع مخاطر جديدة وغير متوقعة.

يتمتع المستخدمون اليوم بقدرة أكبر على التحكم في استنتاج البيانات من هذه النماذج، إلا أن هذه المرونة قد تؤدي أيضًا إلى تقويض الضمانات المتعلقة بالمعرفة الحساسة التي تم تعديلها أو إزالتها. في هذا الإطار، تُستخدم تقنيات تعديل النماذج (Model editing) والتعلم الآلي غير المتعلم (Machine unlearning) لتعديل أو حذف معلومات محددة دون الحاجة إلى إعادة تدريب النماذج من جديد.

مع ذلك، تكشف التقييمات الأمنية الحالية عن قيود رئيسية. فغالبًا ما تتطلب الوصول إلى النموذج الأساسي قبل التعديل أو استخدام مصنّفات مساعده لاكتشاف التعديلات أو إعادة بناء سلوك النموذج السابق. تزيد هذه القيود من صعوبة تأمين المعلومات وعدم السماح بالوصول غير المصرح به.

تظهر الأبحاث الأخيرة أن افتراض اعتبار تقنيات التقطيع (Tokenization) كخطوة تجهيز بسيطة هو أمر خاطئ، إذ يمكن أن تمثل نفس سلسلة الإدخال من خلال طرق تقطيع صالحة بديلة تؤدي إلى مسارات حسابية مختلفة. هذا الامر يسمح للخصوم بتجاوز التعديلات المحلية واستعادة المعلومات التي يُقصد بها الإخفاء.

لإلقاء مزيد من الضوء على هذه المشكلة، تم تقديم أسلوب جديد يُسمى Toketive، وهو هجوم بسيط ولكنه قوي يستغل ثغرات التقطيع لإزالة الحواجز المعلوماتية. يستخدم Toketive النموذج الصادر فقط، ولا يتطلب النموذج الذي تم تعديله أو بيانات التدريب أو نماذج الظل أو مصنفات مساعدة، مما يجعله أكثر خطورة.

على مدار اختباراته على خمسة نماذج لغوية ضخمة (LLMs)، وستة مجموعات بيانات، وتقنيات تعديل وتعليم مختلفة، وجد الباحثون أن 38.6% من تقنيات التقطيع البديلة تتجاوز التعديلات وتستعيد الاستجابة السابقة. وقد حققت Toketive دقة نسبتها 84.2% في اكتشاف الحقائق المعدلة و74.5% في دقة الاستجابة للأفضل خمس، مما يعني أن التعديلات المحلية لا يمكن اعتبارها حدود مقاومة قوية لمعلومات قابلة للتلاعب دون تقييم adversarial دقيق.

هذا الاكتشاف يسلط الضوء على ضرورة إعادة النظر في كيفية تأثير تقنيات التقطيع على أمان المعلومات في نماذج التعلم الآلي. كيف يمكن لمطوري التكنولوجيا وأكاديميين تحصين أنفسهم ضد مثل هذه الثغرات؟ وما هي الخطوات اللازمة لصياغة إجراءات أمان فعالة في المستقبل؟