RCQFusion: Sparse Radar-Camera Query Fusion for Robust 3D Detection
Abstract
Autonomous driving requires reliable perception under diverse and challenging environments. While multi-sensor fusion has become the standard paradigm, exist- ing radar–camera fusion methods largely inherit LiDAR-centric dense BEV-fusion architectures, struggling with radar sparsity, information loss, cross-modal feature misalignment, and high computational cost from dense BEV representations. To address these issues, we present RCQFusion, a sparse radar-camera query fusion framework for 3D detection. Our method introduces a density-aware transformer encoder, a sparse radar-camera fusion module, a multi-modal query generation mechanism, and a hybrid matching module to offer a scal- able and efficient solution for long-range, robust 3D perception in real-world autonomous-driving scenarios. Extensive experiments on nuScenes demonstrate that RCQFusion achieves state-of-the-art radar-camera 3D detection performance, with clear improvements for long-range, dynamic-object, and adverse-condition perception while preserving practical real-time efficiency. Additional evaluation on MAN TruckScenes further shows the generalization ability of RCQFusion to 4D radar sensing and long-range detection scenarios.
est. 32% chance this paper gets accepted at ICLR 2027.
What do you think this paper will get?
All positions stay anonymous.