acceptodds
Under review as a conference paper at ICLR 2027

SceneRoute-AVQA: Scene-Conditioned Trustworthy Fusion for Audio-Visual Question Answering Under Multimodal Degradations

Abstract

Audio-Visual Question Answering (AVQA) requires selecting question-relevant evidence from audio and visual streams. However, real-world inputs often suffer from temporal misalignment, cross-video interference, missing modalities, visual occlusion, and audio-visual noise. These degradations alter modality reliability in a sample- and question-dependent manner, making conventional fixed-weight or unified fusion methods vulnerable to unreliable evidence and over-confident predictions. We propose SceneRoute-AVQA, a scene-conditioned robust framework based on a diagnosis-routing-calibration paradigm. First, scene-conditioned degradation diagnosis uses scene cues, temporal offset estimation, and modality quality assessment to characterize degradation sources, temporal inconsistencies, and modality reliability cues. Second, question-aware reliability fusion jointly considers question semantics and sample-specific modality quality to dynamically select and fuse trustworthy audio-visual evidence. Hierarchical question-scene answer priors are further introduced to mitigate low-resource and imbalanced answer distributions in degraded scenes. Third, robust context and answer calibration exploit scene-consistent contextual information and lightweight logit residuals to stabilize decision boundaries on difficult samples. Experiments under clean conditions and five degraded AVQA settings demonstrate that SceneRoute-AVQA consistently outperforms existing methods across temporal misalignment, cross-video interference, missing modalities, occlusion, and audio-visual noise, confirming its effectiveness in degradation diagnosis, adaptive evidence fusion, and robust answer prediction.

open until 14 Dec 2026

est. 32% chance this paper gets accepted at ICLR 2027.

Reject 68%Accept 32%

What do you think this paper will get?

All positions stay anonymous.

Related papers

Loading the map…

Discussion (0)

Sign in to comment.