Papers by Qishun Yang
Visual Self-Fulfilling Alignment: Shaping Safety-Oriented Personas via Threat-Related Images (2026.acl-long)
Copied to clipboard
| Challenge: | Existing methods require explicit safety labels or contrastive data, yet visual inputs enable harmful outputs. |
| Approach: | They propose a visual self-fulfilling alignment mechanism that fine-tunes vision-language models on neutral VQA tasks without any safety labels. |
| Outcome: | The proposed approach reduces attack success rate, improves response quality, and mitigates over-refusal while preserving general capabilities. |