تشكل العلامات المائية السلوكية (Behavioral Watermarking) خطوة هامة نحو تعزيز أمان النماذج اللغوية الكبرى (Large Language Models). تُعَرِّف تقنية Semantic Behavioral Watermarking (SBW) هوية المالك من خلال خيارات إجراءات النماذج الذكية دون تعديل الرموز الناتجة، مما يجعلها أكثر أمانًا ضد التلاعب.

على الرغم من الجهود السابقة في هذا المجال، إلا أن الأنظمة السابقة كانت عرضة لثغرات عديدة، حيث اعتمدت على ارتباط العلامة المائية برموز إجراءات معينة. وكانت النتائج المثيرة للقلق أنه عند تغيير أسماء الأدوات، تتعطل عملية فك التشفير، مما يؤدي إلى تقليل فعالية العلامات المائية. على سبيل المثال، اختبرت تقنية AgentMark نفسها ووجدت أن القدرة على استرداد البيانات انخفضت إلى 16.8% باستخدام إعادة صياغة بسيطة.

نستطيع أن نرى كيف أن كل نظام سابق كان يركز فقط على عمليات الإزالة دون الأخذ بعين الاعتبار إمكانية تزوير مسار يُظهر بأنه يعود لشخص آخر، وهو ما تم إثباته في علامات نصية عام 2024.

تقدم SBW نهجًا مبتكرًا يعتمد على مجموعات الإجراءات السلوكية وفقًا للتاريخ، مع إدخال نظام تنسيق مقاوم للتصادم، مما يجعل تعيين الحاويات غير متوقع تمامًا في نموذج الأوركل العشوائي. تم اختبار النظام عبر خمسة نماذج وكالات بتدفقات مختلفة، وكشفت النتائج أن الكشف تحت إعادة الكتابة كان بين 0.49 و0.66 لمستوى المجموعة.

هذا التقدم يمثل خطوة نوعية في أمان الذكاء الاصطناعي ولديه القدرة على التخلص من التلاعب التلقائي، مما يفتح آفاق جديدة أمام الاستخدامات التجارية والتقنية.

ويمكنكم الاطلاع على الكود عبر الرابط: https://anonymous.4open.science/r/SBW-Agent-Watermark

ما رأيكم في هذه التقنية الجديدة؟ شاركونا أفكاركم في التعليقات!