في عالم الذكاء الاصطناعي وتحديدًا نماذج اللغة المفتوحة المصدر (Open-source LLMs)، نشهد تقدمًا ملحوظًا في الأداء، مما يثير تساؤلات حول كيفية تتبع النصوص التي تُنتج بواسطة هذه النماذج. ولقد تم اقترح تقنيات جديدة تعتمد على خوارزميات علامات المياه لإدراجها مباشرة ضمن وزن النموذج. ومع ذلك، تعاني هذه العلامات من تأثيرات التعديلات التي تُجرى بعد التدريب، وبخاصة عملية الدمج التي تشكل طريقة شائعة لدمج معارف الخبراء ومنع النسيان الكارثي.
في هذا السياق، تم التوصل إلى ابتكار يحل تلك الإشكالية، حيث قدم الباحثون مفهوم "التدريب العدائي للدمج" (Merge-Adversarial Training)، وهو خوارزمية تدريب عدائية تهدف إلى تعزيز قوة علامات المياه داخل أوزان النموذج لتكون قادرة على الصمود أمام عمليات الدمج اللاحقة.
تظهر النتائج أن هذا النهج يتفوق باستمرار على جميع البدائل المتاحة، حيث حقق نسبة تحسين تصل إلى +51 نقطة مئوية في معدل كشف العلامات (TPR) مع الحفاظ على قدرة النموذج على الأداء في المهام اللاحقة. كما تم تقييم العلامات في سيناريوهات دمج واقعية تمثل حالات استخدام شائعة، مما يشير إلى دور التدريب العدائي كطريقة موثوقة لتعزيز مقاومة علامات المياه ضد التعديلات التي تطرأ بعدها.
بالنظر إلى هذه النتائج، يصبح من الواضح أن دور التعليم العدائي يفتح آفاقًا جديدة للتطبيق في مجال الذكاء الاصطناعي، مما يعزز من أمان هذه النماذج ويشجع على ابتكار تكنولوجيا أكثر موثوقية.
تقنية مبتكرة لجعل علامات المياه في نماذج اللغة مفتوحة المصدر مقاومة للدمج!
تجاوزت نماذج اللغة المفتوحة المصدر (Open-source LLMs) مستوى الأداء المتوقع، والآن، تم تطوير تقنية تساعد في جعل علامات المياه الخاصة بها مستقرة حتى بعد دمج النماذج. اكتشاف مثير ينذر بعصر جديد في أمان البيانات!
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
