في عالم توليد الصور من النصوص (Text-to-Image Generation)، تنطوي نماذج التشتت (Diffusion Models) على قوة بصرية هائلة، لكن التحكم في هذه النماذج يحمل تحديات أمان كبيرة. يعاني المستخدمون من خطر التوجيهات الضارة التي قد تؤدي إلى إنشاء محتوى ينتهك السياسات، مثل العري الصريح أو العنف الجرافيكي.

حاليًا، تعتمد نظم الحماية الموجودة على تصفية الطلبات قبل عملية التوليد أو التصنيف بعد الإنشاء، مما يُبقي عملية التشتت دون حماية مناسبة، وغالبًا ما تُفضي هذه النظم إلى الرفض فقط دون تقديم إصلاح بصري آمن.

إلى هنا، يأتي دور GuardPaint، وهو إطار عمل للترميز البعيد يهدف إلى تأمين توليد الصور. جُهزت GuardPaint لتتدخل داخل عملية التشتت دون الحاجة إلى تعديل النموذج الأساسي. يتم ذلك بواسطة مدقق خفيف يقوم بمراقبة الصور المتوسطة، مما يساعد في تحديد المناطق غير الآمنة وتنشيط إجراءات الترميم عند الحاجة.

يتم توليد الإصلاحات المحتملة بواسطة مُدخل متوافق مع السياسات ومن ثم يتم اختيارها عبر منافسة محمية تقبل التعديلات فقط عند تحسين الامتثال للسياسات مع الحفاظ على جودة الصورة ودقة الطلب. وقد أظهرت التجارب عبر عدة عائلات من الاختراقات مثل SneakPrompt و MMA و PGJ و DACA و RABell، ونماذج UNet/flow-matching بما في ذلك SD~1.5 و SDXL و SD~3.5 و FLUX.1-dev، أن GuardPaint ثبتت فعالية في تقليل نجاح الهجمات وإنتاج المحتوى الضار، مع الحد الأدنى من التأثير على جودة الصورة.

في ختام هذا التقرير، يجب توخي الحذر، فهذه الورقة تحتوي على أمثلة تتعلق بالعري والعنف، مما قد يجده بعض القراء مقلقًا أو مزعجًا.