MIRAGE: Protecting against Malicious Image Editing via False Moderation
MIRAGE uses targeted adversarial perturbations in representation space to cause content moderation classifiers to flag images as policy-violating, achieving over 88% success rate.
Anshul Nasery, Ramnath Kumar, Cho-Jui Hsieh et al.