Papers by Arun Ross
S2H-DPO: Hardness-Aware Preference Optimization for Vision–Language Models (2026.findings-acl)
Copied to clipboard
| Challenge: | Existing methods focus on localized reasoning with pre-specified image indices, bypassing the skills of global visual search and autonomous cross-image comparison. |
| Approach: | They propose a learning framework that constructs multi-image preference data across three hierarchical reasoning levels requiring an increasing level of capabilities. |
| Outcome: | The proposed approach maintains strong single-image reasoning performance while strengthening multi-image understanding capabilities. |