في عالم توليد الصور من النصوص (Text-to-Image Generation)، تنطوي نماذج التشتت (Diffusion Models) على قوة بصرية هائلة، لكن التحكم في هذه النماذج يحمل تحديات أمان كبيرة. يعاني المستخدمون من خطر التوجيهات الضارة التي قد تؤدي إلى إنشاء محتوى ينتهك السياسات، مثل العري الصريح أو العنف الجرافيكي.
حاليًا، تعتمد نظم الحماية الموجودة على تصفية الطلبات قبل عملية التوليد أو التصنيف بعد الإنشاء، مما يُبقي عملية التشتت دون حماية مناسبة، وغالبًا ما تُفضي هذه النظم إلى الرفض فقط دون تقديم إصلاح بصري آمن.
إلى هنا، يأتي دور GuardPaint، وهو إطار عمل للترميز البعيد يهدف إلى تأمين توليد الصور. جُهزت GuardPaint لتتدخل داخل عملية التشتت دون الحاجة إلى تعديل النموذج الأساسي. يتم ذلك بواسطة مدقق خفيف يقوم بمراقبة الصور المتوسطة، مما يساعد في تحديد المناطق غير الآمنة وتنشيط إجراءات الترميم عند الحاجة.
يتم توليد الإصلاحات المحتملة بواسطة مُدخل متوافق مع السياسات ومن ثم يتم اختيارها عبر منافسة محمية تقبل التعديلات فقط عند تحسين الامتثال للسياسات مع الحفاظ على جودة الصورة ودقة الطلب. وقد أظهرت التجارب عبر عدة عائلات من الاختراقات مثل SneakPrompt و MMA و PGJ و DACA و RABell، ونماذج UNet/flow-matching بما في ذلك SD~1.5 و SDXL و SD~3.5 و FLUX.1-dev، أن GuardPaint ثبتت فعالية في تقليل نجاح الهجمات وإنتاج المحتوى الضار، مع الحد الأدنى من التأثير على جودة الصورة.
في ختام هذا التقرير، يجب توخي الحذر، فهذه الورقة تحتوي على أمثلة تتعلق بالعري والعنف، مما قد يجده بعض القراء مقلقًا أو مزعجًا.
GuardPaint: ثورة في أمان توليد الصور من النصوص لتحسين التحكم وإزالة المخاطر!
تقدم GuardPaint حلاً مبتكرًا لتحديات الأمان في نماذج توليد الصور من النصوص، من خلال إدارة آمنة للعمليات الداخلية دون تعديل النموذج الأساسي. يهدف هذا النظام إلى تقليل المحتويات الضارة مع الحفاظ على جودة الصورة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
