في ظل التطورات السريعة في مجالات الذكاء الاصطناعي، أصبحت النماذج التوليدية (Generative Models) قادرة على إنتاج محتوى عالي الجودة من الصور والفيديوهات. ولكن مع هذه الإمكانيات الرائعة تأتي تحديات جديدة، خصوصًا فيما يتعلق بالسلامة، حيث يمكن للنماذج توليد محتويات غير آمنة. من هنا، تظهر أهمية تقنية "إلغاء المفاهيم"، التي تعمل على إزالة المفاهيم غير المرغوب فيها من النماذج المدربة مسبقًا.

ومع ذلك، كانت الطرق الحالية تعاني من نقاط ضعف، حيث كانت عرضة للهجمات التي تستهدف استعادة المحتوى المحذوف. علاوة على ذلك، فإن تحقيق إلغاء قوي للمفاهيم كان غالبًا ما يؤدي إلى تدهور جودة الإنتاج للنماذج عند التعامل مع مفاهيم آمنة وغير ذات صلة، مما يطرح صعوبة في التوازن بين السلامة والأداء.

لذلك، تم تقديم تقنية "إلغاء المفاهيم الموجه بواسطة المصنف" (Classifier-Guided Concept Erasure - CGCE)، وهي إطار عمل فعال يُمكن إضافته بسهولة ويقدم إلغاءً موثوقًا للمفاهيم عبر نماذج توليد متنوعة، دون تعديل أوزانها الأصلية. تستخدم CGCE مصنفًا خفيف الوزن يقوم على تحليل النصوص لاكتشاف وتنقيح الطلبات التي تحتوي على مفاهيم غير مرغوب فيها.

من خلال تعديل الممثلات غير الآمنة فقط في وقت الاستدلال، يمنع أسلوبنا إنشاء محتوى ضار، مع الحفاظ على جودة النموذج الأصلية في السياقات السليمة. لقد أظهرت التجارب الشاملة أن CGCE تحقق أداءً رائدًا في مواجهة مجموعة واسعة من الهجمات السلبية، كما أنها تحافظ على هيكلية توليد عالية، مما يبرز التوازن المثالي بين السلامة والأداء.

إن تنوع تطبيق CGCE يُبرز قوتها، وقد تم إثبات فعاليتها في نماذج مختلفة مثل T2I وT2V، مما يجعلها حلًا عمليًا وفعّالًا لضمان أمان الذكاء الاصطناعي التوليدي.