Papers by Jianqin Yin
Target-Aware Spatio-Temporal Reasoning via Answering Questions in Dynamic Audio-Visual Scenarios (2023.findings-emnlp)
Copied to clipboard
| Challenge: | Audio-visual question answering requires multistep spatio-temporal reasoning over multimodal contexts. |
| Approach: | They propose a new target-aware joint spatio-temporal grounding network for audio-visual question answering . the proposed system integrates audio-vision fusion and question-awful temporal grounding into one module . |
| Outcome: | The proposed method over existing state-of-the-art methods is effective over existing methods . it can focus on audio-visual cues relevant to the query subject by utilizing explicit semantics from the question . |